已结束已结束内部需求管理效率提升系统,预算一万
项目介绍
先开始做项目POC,项目特点是需要解析10000页以上的PDF,PDF的组成结构较为复杂,同一个需求ID可能包含标签、文字描述(可能会不同颜色)、图片描述、内嵌表格等。需要把整个10000页以上的PDF按照规则解析出内容录入数据库。而且PDF的格式可能有多种,需要适配至少5家客户。
岗位画像:Python 数据工程师,有 PDF 解析实战经验。具体技术栈就是 PoC 需要的全部:
必备:Python 熟练;用过 PyMuPDF(fitz)和 pdfplumber(这是管线核心,没用过的不考虑);正则表达式扎实;会写数据校验脚本(三道硬闸门就是校验逻辑);
加分:做过合同/财报/论文等长文档结构化提取项目;了解 PDF 内部对象模型(文本块、矢量线、图像对象、坐标系);有 camelot/tabula 经验;
加分:LLM 应用开发经验、模型训练经验。碰到不规则情况,可以利用LLM来做补充识别。
先开始做项目POC,项目特点是需要解析10000页以上的PDF,PDF的组成结构较为复杂,同一个需求ID可能包含标签、文字描述(可能会不同颜色)、图片描述、内嵌表格等。需要把整个10000页以上的PDF按照规则解析出内容录入数据库。而且PDF的格式可能有多种,需要适配至少5家客户。
岗位画像:Python 数据工程师,有 PDF 解析实战经验。具体技术栈就是 PoC 需要的全部:
必备:Python 熟练;用过 PyMuPDF(fitz)和 pdfplumber(这是管线核心,没用过的不考虑);正则表达式扎实;会写数据校验脚本(三道硬闸门就是校验逻辑);
加分:做过合同/财报/论文等长文档结构化提取项目;了解 PDF 内部对象模型(文本块、矢量线、图像对象、坐标系);有 camelot/tabula 经验;
加分:LLM 应用开发经验、模型训练经验。碰到不规则情况,可以利用LLM来做补充识别。
*************
*************
评论
全部评论
