登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
快手可图大模型的技术演进与应用探索
文化传媒
2024-10-28
李岩
全球人工智能开发与应用大会
,
可图大模型介绍
快手自研大模型体系全景图
:涵盖视频生成、图像生成、多模态大语言模型、大语言模型等。
可图(Kolors)大模型
:支持中英文双语文生图,效果媲美Midjourney-v6,支持256字符文本输入,具备中英文写字能力。
开源情况
:2024年7月6日全面开源,在HuggingFace和GitHub上线,包括模型权重和完整代码,供个人开发者免费使用。
开源社区反响
:Bilibili平台出现相关教程,插件生态逐步完善(如IP-Adapter-Plus等)。
开源思考逻辑
:不同于stability.ai的失败案例,快手认为开源模型需结合SFT和安全对齐,强调生态共建。
可图大模型技术讨论
一、怎样选择合适的文本表征
CLIP文本表征
:图文对比学习,降低训练难度,但细粒度语义理解能力弱。
Encoder-Decoder文本表征
:面向理解问题,但中文语义理解能力不足。
Decoder-only LLM文本表征
:擅长处理长文本,但复杂文本理解效率不高。
选择原则
:英文场景选T5,多文本表征搭配LLM,考虑MultilingualTextEncoder。
二、什么是RLHF的关键因素
QT vs. RLHF
:QT仅建模数据分布,RLHF通过人类反馈优化,效果更好但成本高。
机器评估 vs. 人工评估
:机器评估快但维度单一,人工评估对齐度高但成本高。
关键因素
:奖励模型能精确模拟人类偏好,可拟合人类偏好的模型兼具效率和对齐度。
三、怎样让大模型写好中国字
难点
:开放域中文写字能力,严肃场景依赖结构性线索或约束。
数据类型
:二类训练数据(真实感高但规模小)和一类训练数据(规模大但真实感弱)。
技术要点
:双重可控(TextAdapter和ControlNet)、辅助损失、分阶段训练。
效果
:句准率提升至80%+,字准率提升至90%+。
四、怎样做好虚拟试穿
行业要求
:保模特人脸ID、人体特征、服装款式、细节、效果自然、跨款式试穿稳定。
技术挑战
:可控性是核心难点,未来趋势是小型化通用模型和单一模型解决多种模态生成。
视觉生成方向的未来展望
行业难点
:可控性。
模型尺寸
:视觉生成模型会验证Scaling Law,但小型化通用模型趋势明显。
技术框架
:U-Net到DiT升级,AR框架优势在于融合理解能力,图像生成与视频生成逐步统一。
司法诉讼
:相关诉讼可能增多。
你可能感兴趣
书生万象大模型的技术演进与应用探索
信息技术
全球人工智能开发与应用大会
2024-10-28
大模型时代的可观测技术探索与实践
蚂蚁集团
2023-05-15
大模型时代的可观测技术探索与实践
蚂蚁集团
2023-04-29
国家发改委等两部门印发政务领域AI大模型部署应用指引,机构称大模型的赋能下软件业正加速演进,这家公司与华为合作推出的WPS鸿蒙版已在全端流畅运行
财联社
2025-10-12
在幻觉与超能中前行:大模型参与安全运营的应用探索
安全焦点
2025-08-22
国金互联网传媒快手可灵大模型网测效果优秀AI应用落地加速中
未知机构
2024-06-11
传媒互联网行业周报:关注百度萝卜快跑产业链投资机会,快手将开源文生图大模型可图
信息技术
德邦证券
2024-07-14
传媒互联网行业周报:快手发布可灵大模型,国产AI生视频技术再进一步
信息技术
民生证券
2024-06-10
防录音行业安全白皮书 录音干扰器的技术演进与应用实践
电子设备
深安协&CPS中安网
2026-04-10
6-2 图网络数据在跟风拍摄中的实践与应用 - 李健伟 快手 生产数分techlead
文化传媒
DataFunSummit2022:数据科学在线峰会
2022-06-13