{
  "markdown": "# MiniMax TTS Pipeline Skill\n\n一个TTS Skill，用于将中文口播逐字稿文本通过 MiniMax TTS API 生成高质量音频，自动处理多音字、英文缩写、品牌名、版本号等高频发音错误。\n\n## 工作流程\n\n```\n输入.txt\n  │\n  ├─ Step -1: 环境预检测（检查 API Key）\n  ├─ Step 0:  初始化运行目录 + 标点规范化 + 候选词扫描\n  ├─ Step 1:  大小写规范化判断（LLM）\n  ├─ Step 2:  发音读法判断 + 多音字识别（LLM）\n  ├─ Step 3:  质量复核（LLM）\n  ├─ Step 4:  调用 MiniMax TTS API 生成音频 + 字幕 JSON\n  └─ Step 5:  生成 SRT 字幕\n```\n\n核心数据流：\n\n```\ninput.txt → normalize_punctuation.py → input.txt\n         → scan_terms.py → terms.json（草稿）\n         → [Step 1] 补全规范化 → terms.json\n         → generate_normalized.py → normalized.txt\n         → [Step 2] 补全读法 + 多音字 → terms.json\n         → [Step 3] 复核 → terms.json（终稿）\n         → call_tts.py → output.wav + output.title\n         → title_to_srt.py → output.srt\n```\n\n## 输出文件\n\n每次运行在输入文件同目录下创建 `tts-YYYYMMDD-HHMMSS/` 目录：\n\n| 文件 | 说明 |\n|------|------|\n| `input.raw.txt` | 原始输入（只读） |\n| `input.txt` | 标点规范化后的输入（只读） |\n| `terms.json` | 全流程唯一结构化工作文件 |\n| `normalized.txt` | 规范化后的文本 |\n| `output.wav` | TTS 输出音频 |\n| `output.title` | MiniMax 返回的字级时间戳字幕 JSON |\n| `output.srt` | SRT 字幕文件 |\n\n## 快速开始\n\n### 1. 安装 Skill\n\n通过 `npx skills add YangAgent/minimax-tts-pipeline` 命令安装\n\n### 2. 配置 API Key\n\n在 `skills/minimax-tts-pipeline/.env` 中配置：\n\n```\nMINIMAX_API_KEY=your_api_key_here\n```\n\n首次使用时 Skill 也会自动检测并提示输入。\n\n### 3. 使用\n\n在 Agent 中触发 Skill，提供文本文件路径即可：\n\n> 使用 MiniMax 生成口播音频，内容文件路径：/path/to/your/script.txt\n\n### 4. 自定义发音规则\n\n支持通过对话管理发音规则，规则持久化到 `user-rules.json`：\n\n- 添加：`\"Qwen 都读作千问\"`\n- 查询：`\"看看有哪些发音规则\"`\n- 删除：`\"删掉 Qwen 的规则\"`\n- 修改：`\"把 Qwen 的读法改成千问三\"`\n\n用户规则优先级最高，各步骤处理时会优先采用。\n\n### 5. 调整声音参数\n\n修改 `scripts/call_tts.py` 中 `voice_setting` 对象：\n\n| 参数 | 说明 | 范围 | 默认值 |\n|------|------|------|--------|\n| `voice_id` | 音色 ID | 见 MiniMax 文档 | `male-qn-qingse` |\n| `speed` | 语速 | `[0.5, 2]` | `1` |\n| `vol` | 音量 | `(0, 10]` | `1` |\n| `pitch` | 语调 | `[-12, 12]` | `0` |\n\n## 项目结构\n\n```\nskills/minimax-tts-pipeline/\n├── SKILL.md                    # Skill 定义（触发条件、工作流、约束）\n├── .env                        # MiniMax API Key\n├── user-rules.json             # 用户自定义发音规则\n├── scripts/\n│   ├── normalize_punctuation.py  # 标点规范化\n│   ├── scan_terms.py             # 候选词提取\n│   ├── validate_terms.py         # terms.json 校验\n│   ├── generate_normalized.py    # 生成规范化文本\n│   ├── call_tts.py               # 调用 MiniMax TTS API\n│   └── title_to_srt.py           # 生成 SRT 字幕\n└── references/\n    ├── pronunciation-rules.md    # 发音规则速查\n    ├── manage-user-rules.md      # 用户规则管理指引\n    ├── api-voice-settings.md     # API 声音参数说明\n    ├── step-1-normalize.md       # Step 1 操作指南\n    ├── step-2-reading.md         # Step 2 操作指南\n    └── step-3-review.md          # Step 3 操作指南\n```\n\n## 设计原则\n\n- **LLM 只改 terms.json**：文本替换、tone 生成、API 调用全部由 Python 脚本执行\n- **单文件工作流**：全流程只维护一份 `terms.json`，各步骤直接修改同一文件\n- **阶段校验**：每个阶段完成后运行校验脚本，失败则停止，不进入下一阶段\n- **不过度控制**：MiniMax TTS 本身能正确朗读大部分常见英文词，只为真正容易读错的词添加 tone 规则\n\n## 依赖\n\n- Python 3.10+\n- `requests` 库\n- MiniMax API Key（Speech 2.8 Turbo 模型）\n",
  "bytes": 2883,
  "sha": "eae46e40b194aa325b932eddc55f9dffe6fd7829ca565794032a75a43b877c02",
  "repo_slug": "yangagent/minimax-tts-pipeline-skill",
  "fonte": "repo",
  "truncated": false,
  "api": "https://api.agentalog.com/api/listings/skl_yangagent_minimax_tts_pipeline_skill_min_0a346238/readme"
}