工作职责:
1、负责公司分布式爬虫系统的设计与开发、日常维护及性能优化等,打造高可用的数据采集、数据处理与分析的分布式资源管控与任务调度平台;
2、负责或参与分析网站特征、js逆向,反爬破解等(加分项);
3、负责对爬取数据进行结构化、归一化,衍生变量计算,去重、分类、垃圾过滤、质量分析等;
4、负责或参与爬虫核心算法和策略优化,提升爬虫抓取效率和质量。
任职要求:
1、 熟练掌握python或者java常规开发(两者都掌握优先),扎实的数据结构与算法能力。
2、 熟悉http协议及原理,ajax、jsonp等,
3、 熟悉使用浏览器调试工具、fiddler等进行抓包分析,捕捉分析网站特征,对模拟请求、模拟登陆等有一定了解
4、熟悉scrapy、webmagic等经典爬虫框架的使用及其原理
5、熟悉xpath、jsoup、fastjson等数据解析处理工具的使用
6、有掌握使用selenium驱动phandomjs无头浏览器或chrome、firefox等浏览器内核经验者优先
7、有Hadoop/Spark/Druid等分布式平台相关使用经验优先。
8、可以长时间实习优先,2020届毕业生优先。
当前职位已下线
为你揭秘各职业的工作内容|薪资水平…
使用python技术从事产品服务开发设计、爬虫服务、数据分析等业务的人员。