背景与需求
软件作为网络空间的基石,其自主可控和安全可信面临重大挑战。关键软件长期由国外主导,存在断供、安全和知识产权风险。同时,软件安全风险日益增加,未知漏洞成为网络攻击的重要突破口。
关键问题
软件开发与安全可信面临的核心问题是分析、理解和防范目标(闭源)软件的安全问题。现有工具难以有效分析二进制程序,且缺乏对软件语义的理解,导致安全分析效率低下。
智能化解决方案
提出基于大语言模型的智能化解决方案,通过机器语言大模型(MLM)实现软件的自主可控和安全可信。MLM能够理解二进制程序语义,超越人类专家水平,高效辅助逆向分析。
关键技术突破
- 融合领域知识的模型优化:修改模型设计,融入代码领域知识,提升机器语言模型的理解能力。
- 基于对比学习的语义理解:利用对比学习技术,使得语义相似的二进制代码embedding接近,提高语义理解准确性。
- 基于多模态学习的语义理解:利用多模态技术,将语义空间与人类意图对齐,更准确地表示二进制代码语义。
解决方案优势
MLM的核心功能全面超越IDA Pro,支持多架构结构分析、跳转函数、反控制流分析等,实现全场景智能化,开创软件分析新范式。
典型应用
- 软件逆向分析:将黑盒二进制程序变成白盒代码,解放专家从繁琐的底层代码分析中,专注高层分析任务。
- 软件生态迁移:实现信创国产化、老旧软件升级迁移,突破卡脖子技术。
- 软件供应链分析:进行软件成分反编译生成C代码,进行软件一致性检测、漏洞挖掘、软件版权保护分析。
应用场景
MLM广泛应用于软件逆向分析、软件生态迁移、软件供应链分析等领域,解决采购痛点,实现快速漏洞挖掘、破解取证等难题。
总结
机器语言大模型(MLM)通过智能化解决方案,有效提升了软件自主可控和安全可信水平,为软件分析领域带来了革命性突破,开创了新的分析范式。