为什么长篇文本翻译要用Wenyi?与普通AI翻译的5个本质区别
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi
长篇文本翻译是 AI 翻译最容易"露馅"的场景:把小说一段段丢给普通大模型,往往前几章还不错,越往后人名越乱、人称越飘、文风越像"翻译腔"。Wenyi(文译)正是为书籍和长文写作设计的全书级 AI 翻译工具——它不逐段孤立翻译,而是让整本书始终处于模型的"视野"之中,实现全书理解、术语一致与取证式审校。
如果你翻译过几十万字的作品,会发现下面这 5 个差异,每一项都戳在长篇翻译的痛点上。
区别一:先"读完"整本书,再动笔翻译 📖
普通 AI 翻译是无状态的:翻译第 30 章时,模型完全不认识第 3 章埋下的伏笔。
Wenyi 在翻译正文之前,会先执行一次全书预扫(prescan):
- 为每一章生成章节梗概
- 生成一份全书概要(synopsis)
- 每个翻译批次都会注入:风格指南、全书概要、当前章节梗概、相关术语、最近已译上下文,以及下一段只读预览
这意味着第 5 章出现的人物,第 2 章就能用对称呼;跨段落未完成的句子,也不会被"硬着头皮补结尾"。预扫结果可缓存复用,重跑不会重复收费。
上图为 Wenyi 生成的双语对照版 EPUB:译文在前,原文视觉淡化对照,方便审校与阅读。
详细说明见 docs/pipeline.md,章节概要的实现在 packages/core/wenyi_core/agents/synopsis.py。
区别二:术语实时抽取,前后译名自动一致
长篇翻译最常见的事故:同一个角色前 5 章译"王",后 5 章译"王小凤"。
Wenyi 的实时术语表在翻译推进中持续工作:
- 自动抽取人名、地名、组织、术语与固定表达
- 检测到同一术语出现冲突译法时,会明确提示你裁决
- 后续批次只注入与当前章节相关的术语,既保证一致又不撑爆上下文
它不是"事后整理词表",而是边译边约束:上一批刚确定的译名,下一批就照着用。术语模块位于 packages/core/wenyi_core/glossary/,翻译中也可用glossary list、glossary conflicts随时检查。
区别三:翻译 → 润色 → 取证式全书审校,三道质量闸 🛠️
普通 AI 翻译是"一次生成,听天由命"。Wenyi 是多阶段流水线:
- 分批翻译:模型必须返回与输入段落数严格对齐的结果,不齐就重试,失败再逐段降级
- 润色(可选):由强档模型在同一段对话里二次打磨,提升目标语言流畅度且不改变语义
- Agent Review(默认开启):全书译完后启动独立的取证式审校——并发检查各章节片段,发现问题时可按需提供证据(查某条术语、某段上下文、某章风格),确认的问题会生成整段级修订并盲审复核,避免"改了 A 又改回 A"
审校过程完全留痕,Web 界面里能看到每个步骤的 Token 用量、缓存命中率与运行记录:
审校 Agent 的核心逻辑见 packages/core/wenyi_core/agents/reviewer.py 与 packages/core/wenyi_core/review/。
区别四:中断不心疼,同一命令断点续跑 🔄
一本 50 万字的小说可能要翻译几个小时。普通做法中途断网、超时、限流——进度全废。
Wenyi 采用批次级检查点:每个完成的批次立即落盘,章节状态、术语库、用量记录全部持久化。任意中断(Ctrl+C、网络超时、限流)后,重新执行同一条命令即可从断点继续,已完成的批次自动跳过、不重复计费。
跑完后还有 Web 工作台兜底:原文译文并排对照,逐段右键编辑、查看改动历史、复制文本,人工校阅有完整的版本记录:
区别五:产出的是"一本书",而不是一段纯文本 ⚙️
把 AI 翻译结果粘回原书,格式、目录、图片全丢。Wenyi 直接把译文回填进原书的 XHTML 模板:
| 输入 | 输出 |
|---|---|
| EPUB、FB2、TXT、Markdown、HTML、PDF、DOCX | EPUB(单语 / 双语)、TXT、HTML、Markdown、DOCX |
| SRT 字幕 | 单语 / 双语字幕 |
- EPUB 输出尽量保留原书样式、图片、目录与锚点
- 可选双语对照版,原文淡化显示,支持深色模式
- 脚注/尾注标记在翻译中剥离、翻译后自动回填到正确位置
快速上手(5 分钟)
环境要求 Python 3.10+ 和 uv:
git clone https://gitcode.com/BigDawnGhost/wenyi cd wenyi uv sync配置一个 API Key 后,一条命令跑完全流程(解析 → 预扫 → 翻译 → 审校 → 组装):
uv run wenyi translate book.epub更多选项(润色开关、双语输出、只译某章、导出 TXT)见 README.md 与 docs/usage.md;模型路由、流水线开关等配置见 docs/configuration.md,全局配置文件为 config.yaml。
小结
| 维度 | 普通 AI 翻译 | Wenyi |
|---|---|---|
| 上下文 | 孤立的段落 | 全书概要 + 章节梗概 + 滚动上下文 |
| 术语 | 事后人工整理 | 实时抽取、冲突检测、即时约束后续批次 |
| 质量 | 一次生成 | 翻译 → 润色 → 取证式全书审校 |
| 可靠性 | 中断即作废 | 批次检查点,同一命令续跑 |
| 产出 | 纯文本 | 保留版式的 EPUB / DOCX / 双语对照 |
一句话:普通 AI 翻译是"逐段搬运工",Wenyi 是"读完书再动笔的译者"。当你面对的是整本书而非整段话时,这就是本质区别。📚
【免费下载链接】wenyi将被语言阻隔的作品,带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考