已结束已结束内部需求管理效率提升系统,预算一万

项目介绍

先开始做项目POC,项目特点是需要解析10000页以上的PDF,PDF的组成结构较为复杂,同一个需求ID可能包含标签、文字描述(可能会不同颜色)、图片描述、内嵌表格等。需要把整个10000页以上的PDF按照规则解析出内容录入数据库。而且PDF的格式可能有多种,需要适配至少5家客户。

岗位画像:Python 数据工程师,有 PDF 解析实战经验。具体技术栈就是 PoC 需要的全部:

必备:Python 熟练;用过 PyMuPDF(fitz)和 pdfplumber(这是管线核心,没用过的不考虑);正则表达式扎实;会写数据校验脚本(三道硬闸门就是校验逻辑);

加分:做过合同/财报/论文等长文档结构化提取项目;了解 PDF 内部对象模型(文本块、矢量线、图像对象、坐标系);有 camelot/tabula 经验;

加分:LLM 应用开发经验、模型训练经验。碰到不规则情况,可以利用LLM来做补充识别。
已有4人报名
*************
*************
浏览 2625
点赞
6评论
收藏
2分享

手机扫一扫分享

分享
举报
评论
图片
表情
全部评论
狼鸣3天前
全栈开发,擅长各种文本图片解析
点赞回复
菜头3天前
有pdf解析经验,文本,坐标,公示,表格,图片,全栈工程师,
点赞回复
善于python处理
点赞回复
道组境3天前
前阿里p8高级技术专家全栈,欢迎联系
点赞回复
initial3天前
有pdf解析经验,文本,坐标,公示,表格,图片
点赞回复
说说3天前
双擎解析+三道校验+AI兜底,精准适配异构复杂PDF。
点赞回复
推荐
点赞
6评论
收藏
2分享

手机扫一扫分享

分享
举报