已结束已结束爬虫,预算18k

第一步:需要从目标站点(公开网站)中爬取文档(格式以网页html为主,少量pdf、word、excel)

第二步:清晰出5-10个目标数据(格式非常固定)

第三步:进行后端接口开发



第一个模块:监管处罚数据库

(1)站点:共80个左右,都是公开的网站信息

(2)示例:https://shanghai.pbc.gov.cn/fzhshanghai/113577/114832/114918/index.html

(3)格式:以htlm为主,少量pdf、word、excel

(4)流程:先爬取→文本解析和数据提取→接口开发,并实现每日更新



第二个模块:资本市场信息聚合

(1)站点:共180个左右,都是公开的网站信息

(2)示例:http://www.csrc.gov.cn/csrc/c100028/common_xq_list.shtml

(3)格式:绝大部分是htlm,里面会嵌入少量图片

(4)流程:无需数据提取,信息保留在需求方的网站,并实现每日更新
已有6人报名
*************
*************
浏览 2835
点赞
12评论
1收藏
1分享

手机扫一扫分享

分享
举报
评论
图片
表情
全部评论
小圆仔昨天
做过类似的,可以做
点赞回复
范小刀昨天
专业爬虫程序员,可以做,所有需求都可以实现
点赞回复
做过类似的 ,8年爬虫经验可做
点赞回复
吴晓贤昨天
这个可以,能看到的数据都可以爬
点赞回复
FC昨天
才做完一个 细节详聊
点赞回复
LY昨天
各种开发可做,此项目看起来不是很难。
点赞回复
有同类开发经验,可以开发
点赞回复
熟悉爬虫的动态爬取、多线程与自动化及JS 逆向等
点赞回复
前阿里P8全栈高级专家,20几年工作经验,这个相当简单。
点赞回复
达布溜昨天
有现成爬虫工具,有python爬虫实战经验
点赞回复
加载更多
推荐
点赞
12评论
1收藏
1分享

手机扫一扫分享

分享
举报