最终版
## 痛点
公文、汇报、论文都有严格的排版规范,但排版至今是纯体力活:
字体字号、行距缩进、标题层级、编号体例,一份几十页的文档要逐段手调,
而且"规范"往往只存在于老师傅的经验或一份没人细看的 Word 模板里。
## 我们要解决的问题
用户只给两样东西——**格式来源**(一段自然语言规范,或一份排好版的 Word 模板)
和**待排版的目标文档**,Agent 自主完成理解、判断与执行,
输出排版好的 docx、一份修改对照报告,以及一份**修订模式文档**。
## 核心设计:两个 JSON 的契约
LLM 在整个系统里只被允许产出两个结构化结果,**永远不直接生成或修改 docx**:
1. **FormatSpec**——从规范文字或模板中读出的格式规则(字体/字号/行距/缩进/页边距/编号体例)
2. **RoleMap**——对目标文档每一段的结构判断(标题/各级标题/正文/落款/日期)
真正的文档改写全部由**确定性代码**完成:把规则写成 Word **命名样式**,
输出文档在 Word 里可以继续正常编辑,而不是一堆刷死的直接格式。
## 能力矩阵(四象限全覆盖)
| 格式来源 \ 目标文档 | 纯文本无结构 | 有序号/自动编号 |
|---|---|---|
| **自然语言规范** | LLM 语义理解段落角色 | 编号惯例确定性判级,省模型调用 |
| **Word 模板** | 脚本直读模板样式 + LLM 标注 | 自动编号 XML 识别,零幻觉 |
- 规范抽取失败时,JSON Schema 校验器把错误回喂 LLM 自我修正(过程全程可见)
- 无序号文档靠语义,有序号文档规则先行——成本与可靠性按场景自适应
## 信任设计(企业敢用的关键)
- **修订模式文档**:每一处格式改动都以 Word 修订记录呈现,
审阅视图逐条接受/拒绝,格式审查的主动权在人手里
- **修改对照报告**:段落级改动明细(角色、样式、改动字段),可交付归档
- **视觉自检**:渲染成图后由多模态模型对照规范逐条质检,
发现偏差定向修复重排一次,不做开放循环
## 演示
四个真实案例覆盖能力矩阵全象限:从无序号的体检通知,到带三级序号的
工作方案,到用真实党委会议题模板重排投资议案——包括 Word 自动编号
(文字里根本没有序号)这类真实世界的硬骨头。
## 技术要点
- 不依赖任何 Agent 框架,OpenAI 兼容接口直连模型(Kimi K3)
- 关键 XML 写法全部实机验证:中文字体 eastAsia、固定行距、按字符缩进、
行网格、样式级自动编号
- 流式 Agent 工作日志:理解、校验、自我修正、执行全程直播