1.7 KiB
1.7 KiB
name, description
| name | description |
|---|---|
| edge-pdf-docs | edge_collector PDF 文档读取、提取、转换和交付检查规范。用于处理客户 PDF、导出报告、部署手册、测试报告、扫描件、表格提取、PDF 转图片预览,以及从 DOCX/Markdown 生成 PDF 交付件。 |
edge_collector PDF 处理
适用场景
- 阅读客户 PDF 需求、手册、协议资料。
- 从 PDF 提取文字或表格。
- 把 Word/Markdown 报告转 PDF。
- 将 PDF 页面转图片用于视觉检查。
- 合并、拆分或旋转 PDF。
文本提取
优先使用:
pdftotext -layout input.pdf output.txt
需要表格时使用 pdfplumber:
import pdfplumber
with pdfplumber.open("input.pdf") as pdf:
for page in pdf.pages:
print(page.extract_text())
print(page.extract_tables())
扫描件需要 OCR 时,先说明 OCR 可能有识别误差,并保留人工复核步骤。
PDF 转图片
用于检查版式、截图或报告附件:
pdftoppm -png -r 150 input.pdf page
只转指定页:
pdftoppm -png -r 150 -f 1 -l 3 input.pdf page
合并与拆分
优先使用 qpdf:
qpdf --empty --pages a.pdf b.pdf -- merged.pdf
qpdf input.pdf --pages . 1-5 -- part.pdf
交付检查
生成 PDF 后检查:
- 页面是否缺失。
- 中文是否乱码。
- 表格是否截断。
- 图片是否模糊。
- 页眉页脚和页码是否正确。
- 是否包含未脱敏的密钥、账号、密码、内网地址。
当前项目注意
- 用户手册 PDF 不写内部技术细节。
- 故障报告 PDF 要保留证据截图和验证命令摘要。
- 部署报告 PDF 要写清目标主机但隐藏敏感凭据。
- AI 分析报告 PDF 不展示内部 AI Provider 和模型配置。