IT人力外包人才简历库

返回列表

数据采集工程师

驻场外包人员
工作年限:3年 意向城市:杭州 浏览:7次 发布时间:近期

技能标签

Python HTTP协议 XPath 正则表达式 MongoDB Redis MySQL Scrapy Selenium 数据抓取 分布式爬虫 反爬策略 数据解析 数据存储 网络协议

专业技能

精通Python3.7+,熟悉异步编程(asyncio)及并发处理;精通HTTP/HTTPS协议及RESTful API设计,熟练掌握XPath、正则表达式、JSONPath等数据解析技术;熟悉MongoDB分片集群架构及索引优化,掌握Redis分布式锁与缓存策略,精通MySQL索引优化与事务处理;熟练使用Scrapy框架进行分布式爬虫开发,具备Selenium、Playwright等浏览器自动化工具实战经验;熟悉反爬虫策略识别与应对(IP封禁、验证码识别、请求频率控制)

工作履历(脱敏处理)

专注于网络数据采集系统研发,主导设计并实现多平台分布式爬虫架构,日均处理数据量超百万条。深度优化数据解析模块,通过XPath+正则表达式组合方案提升数据提取效率40%。搭建Redis代理池系统,实现IP轮换与请求频率控制,有效应对反爬虫机制。主导MongoDB分片集群部署,通过索引优化使数据查询效率提升60%。开发Selenium+Playwright混合爬虫方案,成功突破动态渲染页面数据采集难题。

项目经验(脱敏处理)

1. 头部视频平台数据采集系统:设计分布式爬虫架构,采用Scrapy-Redis实现任务分发与结果存储,通过Selenium模拟浏览器操作解决动态渲染问题,日均采集视频元数据超50万条。2. 搜索引擎数据抓取平台:构建反爬虫策略识别系统,集成IP代理池与请求频率控制模块,实现百万级URL的并发抓取,数据准确率保持99.8%。3. 社交媒体舆情分析系统:开发多线程数据解析引擎,结合正则表达式与JSONPath实现复杂数据结构提取,数据存储效率提升50%。4. 实时数据监控平台:设计基于消息队列的异步爬虫架构,通过Redis缓存热点数据降低数据库压力,系统响应时间缩短至200ms以内。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

3年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接