HY-MT近期进展
- WMT2025夺冠:在通用翻译赛道上,HY-MT在31个语种中30个语种排名第一,超越Gemini-2.5-pro、CLAUDE4、deepseekv3、qwen3235b等模型。
- 开源:开源HY-MT1.5-7b、HY-MT1.5-1.8b、HY-MT-Chimera三个模型,重点支持33个语种互译,包括5种民汉语言/方言互译和俚语翻译。开源28天下载量超30W次,Huggingface首页趋势榜排名第一。
- 多场景应用落地:接入腾讯会议(实时翻译、会后翻译)、腾讯游戏出海翻译、企业微信(聊天记录翻译、邮件翻译)、微信读书(划词翻译、书籍翻译)、QQ浏览器(文件翻译、划词翻译)、腾讯海外客服、腾讯云翻译等。
HY-MT效果与CASE分享
- 多次强调HY-MT在翻译效果上的优势,具体案例和应用场景未详细展开。
HY-MT训练方案详解
- 多语言增训(CPT):通过高资源语种桥接获取低资源语种平行语料,并进行多维度质量打分筛选。
- 高质量平行语料获取(SFT):结合网络收集和人工标注,训练融合模型,再融合多个领先大模型翻译结果提升质量。
- 多语言RM(RL)设计:采用SSR(Simple Self-Rewarding)强化学习训练方案,利用回译方法仅依赖单语数据训练,并通过特定prompt打分进行GRPO强化学习。
- 提升低资源语种翻译效果(RL):低资源语种效果达到同尺寸SOTA水平。
- 提升术语翻译效果(RL):提出TAT-R1训练方法,在RM中引入术语词对齐、术语出现顺序、思维链是否包含关键术语等维度,通用翻译能力不下降的情况下,术语翻译效果大幅提升。
HY-MT应用场景能力建设
- 术语、例句库翻译:建设翻译系统,提供可编辑、实时生效的术语、例句库检索模块,提升模型的术语指令遵循能力。
- 带格式翻译:设计协议承载原始格式信息,借助LLM和词对齐工具构造训练数据,并人工check确保数据质量,通过SFT进行冷启+GRPO强化提升效果。
- 实时翻译:模型小型化,补充口语化数据,通过强化学习不断提升效果,重点增强多轮对话场景的模型上下文翻译一致性。
- 词典翻译&解释性翻译:词典知识注入(牛津词典、21世纪大英汉词典等),例句解释知识注入。
经验总结
- 未详细展开,但隐含内容为HY-MT在翻译领域的综合能力和应用价值。
未来展望
- 多模态翻译、语音端到端翻译、图片/视频翻译。
- 翻译AGENT用memory解决长文翻译一致性等问题。
AI开源模型部署和开发实战教学
- 部署方案概览:三种主流技术路线,HuggingFace Transformers、VLLM、LM Studio。
- HuggingFace Transformers:Transformers Pipeline工作原理,代码示例,核心概念包括统一接口封装、多任务支持、自动模型管理等。
- VLLM核心创新:PagedAttention技术,借鉴操作系统虚拟内存分页思想,将KV Cache划分为固定大小的Block进行动态管理,实现显存高效利用。
- VLLM性能优势与部署方式:量化支持GPTQ/AWQ/INT8,支持超高并发,天然支持长上下文。
- LM Studio核心特性:llama.cpp引擎,图形化界面,无需编写代码,适合非技术用户快速上手;OpenAI兼容API,内置模型市场,支持搜索、浏览、一键下载开源模型。
- 适用人群:非技术用户、教育工作者、学生、快速原型验证者。