一、绪论
随着大学生毕业人数的增加和疫情影响,大学生就业问题成为社会热点。泰迪内推平台聚焦“大数据+”和“人工智能”领域,为缓解毕业生就业压力和满足企业人才需求提供优质岗位推荐,促进产教融合。
二、问题分析
针对泰迪内推平台的找工作和找人才页面,需爬取招聘与求职信息,并进行数据清洗和预处理,构建招聘信息画像和求职者画像。同时,需构建岗位匹配度模型和求职者满意度模型,为求职者和招聘岗位提供匹配推荐。
三、基本假设
假设爬取的招聘信息、求职者信息真实可靠,不考虑求职者对公司未来发展机遇、公司对求职者潜力培养等潜在因素。
四、针对问题一的解决方案
使用爬虫算法爬取泰迪内推网站的找工作和找人才页面信息,进行数据清洗和预处理,存储在CSV文件中。
五、针对问题二的解决方案
应用LDA主题生成模型对招聘信息、求职者自我介绍进行主题词生成,得到其主题关键词。使用K-modes聚类算法,分别对招聘信息、求职者进行聚类,得到每个类别的代表性特征,构建招聘信息画像和求职者画像。
六、针对问题三的解决方案
基于岗位胜任力模型公式,分别构建岗位匹配度模型和求职者满意度模型,从多维度对求职者或招聘岗位进行评估,得到求职者与招聘岗位间的匹配度和满意度。
七、针对问题四的解决方案
基于迁移学习在公开数据集上对模型进行训练,选出最好的模型LightGBM后,基于其预测分数获得求职者推荐排序序列。分别通过三种贪心策略,选择推荐序列中能够最优化履约率的求职者进行推荐,求职者选择接受最高满意度岗位的offer。对比实验表明,使用考虑offer数量的贪心策略能够得到最接近于最佳结果的履约率,其与本数据集履约率极限值的比值为0.7802997。
八、模型的评价与推广
优点: 使用LDA主题生成模型和K-modes聚类算法构建招聘信息画像与求职者画像,并使用迁移学习与集成学习模型构建排序模型,通过贪心策略实现招聘与求职双向推荐,执行效率高,贴合实际招聘流程。
缺点: 需要指定聚类个数,LDA模型基于词袋,KModes算法对离散型数据之间的距离度量有一定的局限性,KModes模型对初始聚类中心敏感。