Skip to content
Skillv1.0.0

pdf

只要 PDF 文件是任务的输入或输出,或者需要被打开、读取、创建、修改,就使用本 Skill。 包括提取文字和表格、查看页面、合并拆分、旋转裁剪、加水印、填写表单、OCR,以及制作或 交付 PDF。不用于既不读取也不产出 PDF 的普通写作或一般数据分析。

by nexus-research-lab(0) 0 installs
Free
Sign in to install

Free account. Installing gives you the manifest plus copy-paste snippets.

See reviews

About

Imported from nexus-research-lab/nexus (skills/pdf/SKILL.md). Install upstream with npx skills add nexus-research-lab/nexus --skill pdf. Copyright stays with the author.

PDF 文档

任务 路径
阅读、问答、视觉审阅 优先用运行时 Read 读取相关页面
提取表格或复杂布局 pdfplumber,并对照原页面
合并、拆分、旋转、裁剪、元数据、水印 pypdf
新建 PDF 用 ReportLab;长文档优先使用 Platypus 流式排版
填写 AcroForm pypdf,同时校验字段树与页面 Widget
扫描件 先看页面图像;只有用户需要可搜索文本时才做 OCR

工作契约

  • 只读问题不改写或重新导出 PDF。
  • 写操作保留原文件并输出新文件;已签名 PDF 默认只读,写入前说明签名会失效。
  • 先直接使用当前环境。依赖导入失败且任务需要时,取得用户同意后在隔离环境安装 ${CLAUDE_SKILL_DIR}/requirements.txt,不要静默修改系统 Python。

读取

  • 长文件只读取与问题相关的页面,但答案必须保留页码依据。
  • 文本抽取不能证明版式、图表、签名或扫描内容;这些信息必须查看页面。
  • 表格抽取后核对表头、跨页行、脚注和合并单元格,不能只相信二维数组。
  • 加密、损坏或无法可靠 OCR 的文件要明确说明,不猜内容。

创建与编辑

  • 新建前确定纸张、用途和阅读场景;中文和其他非拉丁文字注册真实可用字体,避免缺字方块。
  • 可见内容使用明确的页边距、层级和分页;表格重复表头并避免行被裁断。
  • PDF 适合页面级编辑,不适合可靠重排既有正文。正文大改时请求源 DOCX/PPTX 或重建新 PDF。
  • 表单默认保持可交互。更新后核对 get_fields() 中的值、每页 /Widget 的有效值和 /AP 外观; 只有用户明确要求静态成品时才扁平化,并确认 Widget 与 AcroForm 字段树均已移除。

完成条件

  1. pypdf 重新打开最终文件,确认页数、加密状态、页面顺序和表单结构符合任务。
  2. 用 Poppler 渲染全部页面并逐页检查:
pdftoppm -png -r 144 "<output.pdf>" "<empty-qa-dir>/page"
  1. 修复截字、重叠、乱码、黑方块、模糊图片、错误页码、断裂表格和意外空白页后重新渲染。
  2. 缺少 pdftoppm 时可以继续纯文本读取;写任务要说明未完成视觉检查。
  3. 最终只交付 PDF,不附带页面 PNG、构建脚本或临时叠加文件。

Use it

Copy one of these into your project. Installing also returns the manifest and these snippets.

yaml
targets:
  - https://api.opensmartroute.ai/api/v1/registry/nexus-research-lab-nexus-pdf/manifest   # or paste the manifest below

Manifest

An Open Capability Manifest: the router reads it to know what this does, what it costs and when to pick it.

nexus-research-lab-nexus-pdf.ocm.jsonjson
{
  "ocm": "1",
  "id": "nexus-research-lab-nexus-pdf",
  "kind": "skill",
  "name": "pdf",
  "description": "只要 PDF 文件是任务的输入或输出,或者需要被打开、读取、创建、修改,就使用本 Skill。 包括提取文字和表格、查看页面、合并拆分、旋转裁剪、加水印、填写表单、OCR,以及制作或 交付 PDF。不用于既不读取也不产出 PDF 的普通写作或一般数据分析。",
  "publisher": "nexus-research-lab",
  "version": "1.0.0",
  "capabilities": {
    "domains": [
      "general"
    ],
    "tags": [
      "skill-md",
      "pdf",
      "document-reading",
      "document-creation",
      "document-editing",
      "page-analysis",
      "github"
    ],
    "languages": [
      "en"
    ]
  },
  "quality_prior": 0.6,
  "examples": [
    "只要 PDF 文件是任务的输入或输出,或者需要被打开、读取、创建、修改,就使用本 Skill。 包括提取文字和表格、查看页面、合并拆分、旋转裁剪、加水印、填写表单、OCR,以及制作或 交付 PDF。不用于既不读取也不产出 PDF 的普通写作或一般数据分析。"
  ],
  "primary": false,
  "metadata": {
    "source": {
      "provider": "github",
      "repository": "https://github.com/nexus-research-lab/nexus",
      "path": "skills/pdf/SKILL.md",
      "ref": "9a64ac3a6bbc04979384a002178fee84c14c651e",
      "url": "https://github.com/nexus-research-lab/nexus/blob/9a64ac3a6bbc04979384a002178fee84c14c651e/skills/pdf/SKILL.md",
      "key": "nexus-research-lab/nexus/skills/pdf/SKILL.md"
    }
  },
  "instructions": "# PDF 文档\n\n| 任务 | 路径 |\n|---|---|\n| 阅读、问答、视觉审阅 | 优先用运行时 `Read` 读取相关页面 |\n| 提取表格或复杂布局 | 用 `pdfplumber`,并对照原页面 |\n| 合并、拆分、旋转、裁剪、元数据、水印 | 用 `pypdf` |\n| 新建 PDF | 用 ReportLab;长文档优先使用 Platypus 流式排版 |\n| 填写 AcroForm | 用 `pypdf`,同时校验字段树与页面 Widget |\n| 扫描件 | 先看页面图像;只有用户需要可搜索文本时才做 OCR |\n\n## 工作契约\n\n- 只读问题不改写或重新导出 PDF。\n- 写操作保留原文件并输出新文件;已签名 PDF 默认只读,写入前说明签名会失效。\n- 先直接使用当前环境。依赖导入失败且任务需要时,取得用户同意后在隔离环境安装\n  `${CLAUDE_SKILL_DIR}/requirements.txt`,不要静默修改系统 Python。\n\n## 读取\n\n- 长文件只读取与问题相关的页面,但答案必须保留页码依据。\n- 文本抽取不能证明版式、图表、签名或扫描内容;这些信息必须查看页面。\n- 表格抽取后核对表头、跨页行、脚注和合并单元格,不能只相信二维数组。\n- 加密、损坏或无法可靠 OCR 的文件要明确说明,不猜内容。\n\n## 创建与编辑\n\n- 新建前",
  "cost": {
    "context_tokens": 281
  }
}

Fetch it by URL: GET /api/v1/registry/nexus-research-lab-nexus-pdf/manifest?version=1.0.0

Reviews

Star ratings from people who tried it. One review per account; edit yours any time.

No reviews yet. Install it, try it, and be the first to rate it.