IT人力外包人才简历库

返回列表

大数据架构师

驻场外包人员
工作年限:15年 意向城市:北京 浏览:7次 发布时间:近期

技能标签

分布式数据处理 实时数据流处理 Scrapy爬虫框架 Spark分布式计算 HDFS存储架构 数据采集优化 反爬策略设计 数据清洗与ETL 分布式系统调优 大数据平台架构

专业技能

精通Python全栈开发,擅长分布式数据处理与实时流计算。掌握Scrapy分布式爬虫框架,具备IP代理池、反爬策略优化等高级功能开发能力。熟悉Spark生态体系,能完成PySpark分布式ETL开发与优化,擅长数据倾斜处理和资源调度。精通HDFS分布式存储架构,熟悉Kafka实时数据流处理。具备大数据平台架构设计能力,能根据业务需求制定数据采集-处理-分析全链路方案。

工作履历(脱敏处理)

主导构建电商评论洞察系统,通过Scrapy分布式爬虫集群实现千万级评论数据采集,结合Spark完成情感分析与实体提取,建立用户口碑分析模型。设计社交网络影响力分析引擎,采用Kafka实时数据流处理与Spark MLlib实现Node2Vec图嵌入算法,提升关键人物识别准确率20%。搭建搜索引擎网页质量评估体系,通过分布式计算优化千亿级网页质量评分,显著提升搜索结果准确性。持续优化数据处理架构,实现从PB级数据采集到实时分析的全链路解决方案。

项目经验(脱敏处理)

1. 电商评论洞察系统:构建分布式爬虫集群实现千万级评论数据采集,采用Scrapy框架开发IP代理池与反爬策略,通过HDFS存储原始数据。使用Spark完成评论分词、情感分析与实体提取,建立主题模型实现用户反馈聚类分析,为产品迭代提供数据支撑。2. 社交网络影响力分析引擎:设计Kafka实时数据流处理架构,采用Spark进行多轮聚合计算,通过自定义分区策略解决数据倾斜问题。实现改进的Node2Vec图嵌入算法,提升关键人物识别准确率20%,优化营销活动转化率。3. 搜索引擎网页质量评估体系:构建分布式计算框架处理千亿级网页数据,设计多维度质量评分模型,通过资源调度优化提升计算效率,显著改善搜索结果质量。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

15年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接