简历解析的思路 - 来自ResumeSDK简历解析的解说

简历解析的思路无外乎两种:基于纯规则及基于规则+机器学习。做几十甚至上百个字段的解析和识别任务,无论如何,规则是避免不了的。问题是当你的规则有成千甚至上万条的时候,你如何设计一个系统能够让它们一起愉快的协同工作,这是关键。

至于思路的选择,和具体的场景有关:简历类型及想要达到的准确率。

1)当简历有固定的模板:有些应用场景中,简历来自51、智联、猎聘等网站,他们有固定的几种格式,这种简历只需要通过正则+规则的方式进行处理,就能达到很高的准确率;

2)对准确率要求不高:如果无固定模板,但对准确率和召回率要求不高,比如60%、70%左右,这种基于规则的方式也能搞定;

3)当简历无固定模板且准确率要求很高:此时就需要机器学习的介入,特别是对一些实体的识别,毕竟有很多核心字段本身就是实体,比如公司名、学校名等。而对于机器学习的使用,也需要控制在合理的范围内。合理的使用规则+机器学习的方案,能够事半功倍,能使效果提升至90%以上,但这块比较考验算法的经验。

之前看过一篇文章,基于CRF的思路去对不同的分段进行建模,这个思路本身很好,但它只适合学术研究,在应用中显得很不切实际,因为:

1)CRF是监督模型,需要大量的精确的语料去支持,现实中很难标注出这样的语料;

2)当碰到新的badcase时,模型的训练和调优一个流程下来需要不少时间,反而不如基于规则的迭代来的快;

简历解析属于那种前60%~70%的效果能够快速达到,但是后30%的效果则需要投入比前者多得多的工作。若要达到高准确率,还需要有大量的简历库和词典数据去做支撑。

如果您对简历解析技术感兴趣,可以参考一下我们:ResumeSDK简历解析,是由资深BAT算法专家研发的解析系统,欢迎试用。

最后编辑于 :
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容