本研究旨在评估多语言大语言模型在将英语习语、双关语等比喻性语言翻译成全球多种语言时的本地化能力。研究发现,尽管模型能生成语法正确的译文,但在翻译具有文化细微差别的语言时仍存在不足,需要大量人工润色。
核心观点:
- 现有研究多关注语法准确性,而本研究聚焦文化适宜性和整体本地化质量。
- 评估了20种语言的24种方言中由LLM生成的87份电子商务营销邮件翻译样本。
- 人类评审员从忠实度、适配度等方面进行定量评分和定性反馈。
关键数据:
- 不同语言的本地化质量差异显著,即便是同一模型处理相同输入内容,不同语言的输出结果水平也相差很大。
- 日耳曼语族语言(如德语、瑞典语)表现较好,印欧语系-印度雅利安语族整体表现强劲。
- 采用音节文字的语言(日语、韩语)表现尤为出色,而孤立语(如伊博语、普通话)得分最低。
- 小型地区性语言(如韩语、瑞典语)得分超过数据集整体平均值,挑战了“资源可获得性是LLM翻译质量的可靠预测指标”这一假设。
研究结论:
- 习语和双关语是翻译错误最多的内容,模型往往直译导致生硬或与语境不符。
- 成功的翻译会创造性地调整习语,采用与文化相关的替代表达。
- 数据可获得性和书写系统是本地化质量最主要的预测因素。
- 人工修订对于实现自然、生动的翻译仍至关重要。
- 研究结果对“数据获取量增加等同于本地化效果提升”的观点提出了挑战。
- 需要开展更大规模的拓展研究,以提供具有普遍适用性的见解。
局限性:
- 反馈的积极性倾向可能导致更严重的翻译错误未得到充分报告。
- 语言与地区代表性不足,评估人员主要来自欧洲、美洲和印度。
- 数据集规模较小,且每种语言的评估人员不足三人。
- 评估人员的专业背景存在差异。
- LLM模型的多样性有限。