{
  "markdown": "# 📄 ParseFlow\n\n<div align=\"center\">\n\n**AI 驱动的全能文档解析库**\n\n[![npm version](https://img.shields.io/npm/v/parseflow-core.svg)](https://www.npmjs.com/package/parseflow-core)\n[![MCP Server](https://img.shields.io/badge/MCP-Server-blue)](https://www.npmjs.com/package/parseflow-mcp-server)\n[![License: MIT](https://img.shields.io/badge/License-MIT-yellow.svg)](https://opensource.org/licenses/MIT)\n\n[English](./README_EN.md) | **中文**\n\n</div>\n\n---\n\nParseFlow 是一个全面的文档解析解决方案，支持 **PDF**、**Word**、**Excel**、**PowerPoint** 和 **图片 OCR**。它提供独立的核心库和 MCP 服务器，可供 AI 助手使用。\n\n## ✨ 功能特性\n\n### 📄 PDF 支持\n- ✅ 多策略文本提取（原始、格式化、清理）\n- ✅ 按页或按范围提取\n- ✅ 🔐 加密 PDF 密码支持\n- ✅ 📄 PDF 合并、拆分、提取页面\n- ✅ 元数据获取、全文搜索\n\n### 📝 Word / 📊 Excel / 🎯 PowerPoint\n- ✅ 文本提取和搜索\n- ✅ HTML 转换（Word）\n- ✅ 多工作表支持（Excel）\n- ✅ 幻灯片提取（PowerPoint）\n\n### 🔍 OCR 图片识别\n- ✅ 支持 12 种语言\n- ✅ 图片文字提取和搜索\n\n### 🧠 语义搜索\n- ✅ AI 向量嵌入\n- ✅ 智能文档搜索（无需精确关键词）\n\n### 📦 批量处理\n- ✅ 并行处理多个文件\n- ✅ 目录递归扫描\n- ✅ 批量提取和搜索\n\n### 🤖 MCP 服务器\n- ✅ **20 个** AI 助手工具\n- ✅ 支持 Claude Desktop、Windsurf、Cursor\n\n---\n\n## 📦 安装\n\n### 核心库\n\n```bash\nnpm install parseflow-core\n```\n\n### MCP 服务器\n\n```bash\nnpm install -g parseflow-mcp-server\n# 或使用 npx\nnpx parseflow-mcp-server\n```\n\n---\n\n## 🚀 快速开始\n\n### PDF 解析\n\n```typescript\nimport { PDFParser } from 'parseflow-core';\n\nconst parser = new PDFParser();\nconst text = await parser.extractText('document.pdf');\nconst results = await parser.search('document.pdf', '关键词');\n```\n\n### Word 解析\n\n```typescript\nimport { WordParser } from 'parseflow-core';\n\nconst parser = new WordParser();\nconst result = await parser.extractText('report.docx');\nconst html = await parser.extractHTML('report.docx');\n```\n\n### Excel 解析\n\n```typescript\nimport { ExcelParser } from 'parseflow-core';\n\nconst parser = new ExcelParser();\nconst data = await parser.extractData('spreadsheet.xlsx');\nconst results = await parser.searchText('data.xlsx', '收入');\n```\n\n### PowerPoint 解析\n\n```typescript\nimport { PowerPointParser } from 'parseflow-core';\n\nconst parser = new PowerPointParser();\nconst result = await parser.extractText('presentation.pptx');\nconst results = await parser.searchText('slides.pptx', '关键词');\n```\n\n---\n\n## 🛠️ MCP 服务器配置\n\n### Claude Desktop\n\n在 `claude_desktop_config.json` 中添加：\n\n```json\n{\n  \"mcpServers\": {\n    \"parseflow\": {\n      \"command\": \"npx\",\n      \"args\": [\"-y\", \"parseflow-mcp-server\"]\n    }\n  }\n}\n```\n\n### 可用工具（23 个）\n\n| 类别 | 工具 | 描述 |\n|------|------|------|\n| **PDF** | `extract_text` | 提取文本（支持加密 PDF） |\n| | `get_metadata` | 获取元数据 |\n| | `search_pdf` | 全文搜索 |\n| | `extract_images` | 提取图片 |\n| | `get_toc` | 获取目录 |\n| | `merge_pdf` | 合并多个 PDF |\n| | `split_pdf` | 拆分为单页 |\n| | `extract_pdf_pages` | 提取指定页码 |\n| | `add_watermark` | 添加文字水印 |\n| | `add_image_watermark` | 添加图片水印 |\n| | `remove_watermark` | 移除水印（覆盖） |\n| **Word** | `extract_word` | 提取文本/HTML |\n| | `search_word` | 文本搜索 |\n| **Excel** | `extract_excel` | 提取数据 |\n| | `search_excel` | 单元格搜索 |\n| **PPT** | `extract_powerpoint` | 提取幻灯片 |\n| | `search_powerpoint` | 幻灯片搜索 |\n| **OCR** | `extract_ocr` | 图片文字识别 |\n| | `search_ocr` | OCR 文本搜索 |\n| **AI** | `semantic_index` | 文档向量索引 |\n| | `semantic_search` | 语义相似搜索 |\n| **批量** | `batch_extract` | 批量提取多文件 |\n| | `batch_search` | 批量搜索多文件 |\n\n---\n\n## 📈 版本历史\n\n| 版本 | 功能 |\n|------|------|\n| v1.8.0 | 💧 PDF 水印（文字/图片水印） |\n| v1.7.0 | 📦 批量处理（并行处理多文件） |\n| v1.6.0 | 🧠 语义搜索（AI 向量嵌入） |\n| v1.5.0 | 📄 PDF 合并/拆分/提取 |\n| v1.4.0 | 🔐 加密 PDF 支持 |\n| v1.3.0 | 🔍 OCR 图片文字识别 |\n| v1.2.0 | 🎯 PowerPoint 支持 |\n| v1.1.0 | 📝 Word + 📊 Excel 支持 |\n| v1.0.0 | 📄 PDF 基础解析 |\n\n---\n\n## 🔗 链接\n\n- **npm Core**: https://www.npmjs.com/package/parseflow-core\n- **npm MCP**: https://www.npmjs.com/package/parseflow-mcp-server\n- **GitHub**: https://github.com/Libres-coder/ParseFlow\n\n---\n\n## 📄 许可证\n\nMIT License - 详见 [LICENSE](./LICENSE)\n\n---\n\n**Made with ❤️ by Libres-coder**\n",
  "bytes": 3750,
  "sha": "7036a8310f320089292679cf475eb266d2789ea78ddff9c4e5abe9daa23ab23e",
  "repo_slug": "libres-coder/parseflow",
  "fonte": "repo",
  "truncated": false,
  "api": "https://agentalog.com/api/listings/mcp_io_github_libres_coder_parseflow_c082fbdd/readme"
}