核心观点与关键数据
侯容,知乎舰桥平台Leader,在DataFunSummit#2023上分享了其团队在知识体系分类整理、自然语言转筛选条件、自然语言数据分析等方面的技术实践与成果。
1. 知识体系分类整理
- 业务背景:对知识体系进行分类整理,以支持精细化运营和活动场景的快速搭建。
- 解决方案:
- 事件聚合:通过新闻关键信息向量化、多轮聚类、大模型语义判断等步骤,自动生成事件名及对应新闻列表。
- 效果:事件名自动生成,准确率提升,但依赖基础模型对事件合并的判断。
- 知识整理:构建类似map-reduce的框架,通过内容拆分、分类生成、合并等步骤实现多层级内容分类。
- 效果:低成本、全流程自动化,但依赖基础模型对内容的理解。
- 长期计划:通过微调和升级模型进一步提升事件聚合的准确性。
2. 自然语言转筛选条件
- 业务背景:将自然语言转换为筛选条件,降低使用成本,提高工作效率。
- 解决方案:采用微调技术,通过构造不同阶段的筛选条件样本(原子条件、交并差、模糊语句、逻辑错误)进行训练。
- 版本演进:
- 版本1:基础模型缺乏逻辑能力,输出与输入无关。
- 版本2:解决maxtoken截断和重复输出问题。
- 版本3:优化JSON格式错误、额外条件、符号错误等问题。
- 版本4:基本满足简单使用需求,上线。
- 业务效果:
- 结果描述:输入自然语言,输出对应筛选条件组合。
- 效果:降低使用成本,提升工作效率,新手友好,改变传统推广方式,提升沟通效率。
- 待优化点:模糊语言处理,例如“近一个优秀作者写的高质量内容”。
3. 自然语言数据分析
- 业务背景:通过自然语言进行数据分析,满足灵活多变的查询需求。
- 解决方案:采用动态prompt技术,根据用户查询动态生成prompt,包括表字段和few-shot示例。
- 流程:初始化样本,用户查询时通过MMR找到相似问题,生成合适的prompt。
- 业务效果:
- 问题及解决方法:
- 问题1:相似样例太多,效果不好。
- 解法:改用MMR通过多样性避免prompt输入不够。
- 问题2:查询与数据源关联不好。
- 解法:采用产品方案,左上角将业务名称和可用数据源做关联。
- 问题3:用户输入的自然语言很泛。
- 解法:丰富样例,通过口语习惯的逐渐增多来提升准确性。
- 当前问题:准确率不足,复杂查询效果不好。
- 后续计划:对模型进行finetune,加强在各业务场景的表现效果。
4. 总结与展望
- 总结:通过大模型技术,实现了知识体系分类整理、自然语言转筛选条件、自然语言数据分析等功能,有效提升了工作效率和用户体验。
- 痛点:大模型在处理复杂场景和模糊语言时仍存在不足。
- 展望:通过微调、finetune等技术进一步提升模型性能,并探索更多大模型应用场景。