岗位职责:
对公众号推文的标题进行情感分析、文本分类、特征提取并训练打开率预测模型,最终目的是根据往期文本的features和文章的历史传播数据做一个选题预测推荐系统以及标题评估预测系统
岗位要求:
1、计算机专业或相关专业硕士以上学历;
2、掌握基本机器学习算法,如决策树、分类,聚类以及神经网络等;
3、掌握特征工程、数据增强技术 掌握使用python,熟悉python系机器学习工具包的使用(包括但不限于numpy,pandas,sk-learn等),对目前主流的深度学习平台:tensorflow、pytorch等,至少对其中一个有上手经验 ;
4、熟悉自然语言处理中词法,语法和语义分析的问题,如分词、词性标注、命名实体识别、关键词提取、情感分析、主题模型等。熟悉自然语言处理常见算法与模型(如LDA、LSTM、Word2Vec、CNN、RNN等);
5、了解Attention、Transformer、Bert基本原理,了解迁移学习、小样本学习,有文本分类、情感分析、主题分析较丰富经历者优先 。
培训体系:
1.该项目为北大和差评公司合作的科研项目,项目成员有北大的老师以及芝加哥大学的博士后,还有数个北大的助研同学;
2.参与此项目可获得北大和芝加哥大学的相关学术资源,如果之后想申请这两所学校继续深造可以拿到推荐信;
3.该项目本身是前沿的问题,在获得海量实验数据并进行基本文本分析处理的同时,还能获得该领域学术大牛对于文本的分类、聚类以及主题模型构建的指导,而且LDA、SVM、CNN、RNN是业界非常核心的技术,对项目参与者之后科研、工作都有极大的启发意义,同时也能积累项目经验;
4.参与该项目可以对文本挖掘、机器学习、特征工程有更深入的感知以及对学术思考的模式和方法进行培养,对未来深造大有裨益;
5.参与该项目,通过对差评文章的标题、内容、和评论进行基本的中文分词和模型训练,获得text/image mining的应用和经验积累。