Files
wind_power_cal/.claude/skills/edge-pdf-docs/SKILL.md
T
2026-07-14 15:43:18 +08:00

1.7 KiB
Raw Blame History

name, description
name description
edge-pdf-docs edge_collector PDF 文档读取、提取、转换和交付检查规范。用于处理客户 PDF、导出报告、部署手册、测试报告、扫描件、表格提取、PDF 转图片预览,以及从 DOCX/Markdown 生成 PDF 交付件。

edge_collector PDF 处理

适用场景

  • 阅读客户 PDF 需求、手册、协议资料。
  • 从 PDF 提取文字或表格。
  • 把 Word/Markdown 报告转 PDF。
  • 将 PDF 页面转图片用于视觉检查。
  • 合并、拆分或旋转 PDF。

文本提取

优先使用:

pdftotext -layout input.pdf output.txt

需要表格时使用 pdfplumber

import pdfplumber

with pdfplumber.open("input.pdf") as pdf:
    for page in pdf.pages:
        print(page.extract_text())
        print(page.extract_tables())

扫描件需要 OCR 时,先说明 OCR 可能有识别误差,并保留人工复核步骤。

PDF 转图片

用于检查版式、截图或报告附件:

pdftoppm -png -r 150 input.pdf page

只转指定页:

pdftoppm -png -r 150 -f 1 -l 3 input.pdf page

合并与拆分

优先使用 qpdf

qpdf --empty --pages a.pdf b.pdf -- merged.pdf
qpdf input.pdf --pages . 1-5 -- part.pdf

交付检查

生成 PDF 后检查:

  • 页面是否缺失。
  • 中文是否乱码。
  • 表格是否截断。
  • 图片是否模糊。
  • 页眉页脚和页码是否正确。
  • 是否包含未脱敏的密钥、账号、密码、内网地址。

当前项目注意

  • 用户手册 PDF 不写内部技术细节。
  • 故障报告 PDF 要保留证据截图和验证命令摘要。
  • 部署报告 PDF 要写清目标主机但隐藏敏感凭据。
  • AI 分析报告 PDF 不展示内部 AI Provider 和模型配置。