IT人力外包人才简历库

返回列表

网络爬虫开发工程师

驻场外包人员
工作年限:3年 意向城市:杭州 浏览:6次 发布时间:近期

技能标签

Python HTTP协议 XPath解析 正则表达式 MongoDB Redis MySQL Selenium Scrapy 分布式爬虫 网页解析 数据存储 自动化测试 反爬虫策略

专业技能

精通Python编程语言,熟悉Requests/BeautifulSoup等网络请求库,掌握Scrapy分布式爬虫框架。精通HTTP协议及网页抓取原理,熟练使用XPath、CSS选择器、正则表达式进行数据解析。熟悉MongoDB、Redis、MySQL等数据库的使用,具备数据存储与优化经验。熟练运用Selenium处理动态网页内容,掌握反爬虫机制应对策略。具备分布式爬虫架构设计能力,熟悉消息队列(如RabbitMQ)与任务调度技术。

工作履历(脱敏处理)

主导并完成多个高并发数据采集系统的开发与优化,包括但不限于搜索引擎数据采集、社交平台内容抓取、新闻资讯聚合等项目。设计并实现分布式爬虫架构,通过任务分片与负载均衡提升数据采集效率。针对动态网页内容开发Selenium自动化脚本,解决反爬虫机制带来的采集难题。优化数据解析流程,采用XPath与正则表达式组合方案提升数据提取准确率。建立完善的数据库存储方案,实现采集数据的结构化存储与快速查询。

项目经验(脱敏处理)

1. 某大型搜索引擎数据采集项目:设计分布式爬虫架构,采用Scrapy-Redis实现任务分片,日均采集数据量达500万条。通过分析网页结构,使用XPath与正则表达式组合方案提取关键数据字段,解决动态加载内容的采集难题。

2. 社交平台内容抓取系统:开发基于Selenium的自动化采集方案,模拟用户操作突破反爬虫机制。设计数据解析模块,实现评论、点赞、关注等互动数据的结构化存储。

3. 新闻资讯聚合平台:构建多源数据采集系统,整合百度、知乎、今日头条等平台数据。优化爬虫调度策略,实现采集任务的智能分配与异常重试机制。

4. 电商数据监测系统:开发商品信息采集模块,处理动态渲染页面,通过Selenium实现数据提取。设计数据清洗流程,确保采集数据的准确性与完整性。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

3年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接