泰迪内推平台招聘与求职双向系统的构建
研究背景与意义
在新冠疫情后,大学生就业形势严峻,有效利用线上招聘数据实现企业人才与大学生职业的双向匹配成为研究热点。本文以泰迪内推平台为研究对象,旨在通过构建双向推荐系统提高招聘效率,缓解毕业生就业压力。
挖掘目标
- 招聘和求职信息爬取:基于泰迪内推平台“找工作”和“找人才”页面,爬取所有招聘与求职信息并保存至CSV文件。
- 招聘和求职信息的预处理和分析:对爬取数据进行清洗、文本分析,构建用户画像。
- 构建岗位匹配度和求职满意度模型:通过半结构化文本和自由文本评估岗位匹配度和求职者满意度。
- 构建招聘求职双向推荐模型:设计模型提高履约率,实现企业与求职者的有效匹配。
研究方法
- 数据爬取:利用Python的Request、json、Pandas模块,分析URL规律,爬取10920条求职者信息和1575条招聘信息。
- 文本预处理:清洗数据,处理重复值、缺失值、异常值,进行文本字段提取、归类与合并,以及停用词过滤。
- 文本分析:运用Word2vec模型、TF-IDF算法进行文本预处理,绘制整体画像,并通过k-means++算法进行聚类分析,命名各类求职者和招聘岗位。
- 模型构建:
- 岗位匹配度和求职者满意度模型:综合考虑半结构化文本和自由文本,构建Topsis-Fuzzy模型评估匹配度和满意度,并利用向量空间模型修正结果。
- 招聘求职双向推荐模型:基于互惠概率、贪心优化和动态规划分别构建三种推荐模型,对比分析其履约率和发送offer的轮数。
研究结论
- 用户画像分析:
- 招聘岗位多为广州市的互联网相关企业,注重数据分析、数据挖掘能力,学历要求本科以上,工作经验要求相对较低。
- 求职者多为具备数据分析、数据挖掘技能但缺乏经验,期望在一线城市工作,获得中等水平薪资。
- 聚类分析将招聘岗位分为四类:策马奔腾型、经验丰富型、智慧前沿型、持续探索型;求职者分为三类:高薪求职者、目标求职者、入门求职者。
- 模型对比:
- 三种模型的履约率均随𝛼增加呈阶梯式下降。
- 当𝛼∈[0,0.2501]时,基于动态规划的模型履约率最高(60.65%),且发送offer的轮数最少(3轮)。
- 当𝛼>0.43时,贪心优化和动态规划模型的履约率相同。
- 当𝛼>0.54时,三种模型履约率相同,模型A(互惠概率模型)简单高效。
- 当𝛼>0.76时,三种模型履约率均为0。
- 最优模型:基于动态规划的双向推荐模型在𝛼=0时表现最优,以最低成本达到最高履约率。
关键数据
- 爬取数据:10920条求职者信息,1575条招聘信息。
- 聚类结果:招聘岗位4类,求职者3类。
- 模型履约率:动态规划模型在𝛼=0时最高(60.65%)。
- 发送offer轮数:动态规划模型在𝛼=0时最少(3轮)。