IT人力外包人才简历库

返回列表

数据工程专家

驻场外包人员
工作年限:15年 意向城市:杭州 浏览:48次 发布时间:近期

技能标签

Python Scrapy Spark Pandas Hadoop Kafka 分布式计算 数据清洗 ETL 机器学习 数据建模 反爬策略 分布式系统 数据架构 实时计算

专业技能

精通Python全栈开发,擅长构建分布式数据处理架构。深度掌握Requests库进行网络请求处理,熟练运用Scrapy框架搭建分布式爬虫系统,具备Spider定制、Item Pipeline优化及Middleware开发能力。精通Pandas进行数据清洗与转换,擅长Spark分布式计算生态,熟练运用PySpark完成TB级数据ETL流程。熟悉Hadoop生态组件,具备Kafka实时数据处理经验,熟悉分布式系统架构设计与调优。

工作履历(脱敏处理)

主导构建分布式数据采集体系,设计智能代理IP调度算法,实现日均千万级数据抓取。开发数据清洗管道,通过Pandas与Spark组合处理PB级结构化数据,建立特征工程体系。优化分布式计算架构,采用自定义分区策略解决数据倾斜问题,将计算效率提升200%。设计实时数据处理流水线,整合Kafka与Spark Streaming实现毫秒级数据响应,支撑多业务场景实时分析需求。

项目经验(脱敏处理)

1. 某电商平台评论分析系统:构建分布式爬虫集群,采用Scrapy框架实现智能代理IP调度,日均抓取千万级评论数据。基于Spark构建数据处理流水线,完成评论分词、情感分析及实体提取,训练主题模型实现缺陷分类。系统提升产品缺陷发现时效48小时,支持产品迭代决策。2. 社交网络影响力分析引擎:设计分布式计算架构,采用Spark处理亿级关系数据,通过PageRank算法识别关键节点。创新性应用Node2Vec模型实现图嵌入,提升关键人物识别准确率20%,优化营销转化效率。3. 搜索引擎质量评估体系:搭建分布式数据处理框架,采用Hadoop+Spark处理千亿级网页数据,设计质量评估指标体系。通过特征工程优化索引质量,提升搜索结果相关性,降低用户投诉率30%。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

15年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接