功能概述
HTML批量翻译工具采用三阶段处理架构,能够智能地批量翻译HTML文件中的英文内容为中文,同时保护HTML结构不被破坏。
三阶段处理流程
阶段1:统计 (Collect)
- 扫描所有 HTML 文件(跳过 backup/node_modules/.git)
- 使用 BeautifulSoup 解析 HTML 结构
- 提取可见文本(跳过图标、路径、script等)
- 记录每个词在哪些文件的哪些行出现
- 生成 word_locations.json
阶段2:翻译 (Translate)
- 从 word_locations.json 提取所有唯一词
- 使用 Google 翻译批量翻译(每批50个词)
- 使用换行符分隔词汇,保证翻译质量
- 生成 translations.json
阶段3:应用 (Apply)
- 读取 word_locations.json 和 translations.json
- 创建文件备份(可选)
- 对每个文件按行号从后往前智能替换
- 使用单词边界匹配,避免误替换
- 跳过图标元素、属性值中的路径
运行模式
| 模式 | 功能 | 适用场景 |
| 全自动模式VIP |
完整流程:统计→翻译→应用 |
首次使用、完整项目翻译 |
| 仅统计 |
只执行统计阶段 |
分析词汇分布 |
| 仅翻译VIP |
只执行翻译阶段 |
重新翻译,保留统计结果 |
| 仅应用VIP |
只执行应用阶段 |
翻译完成,只应用到文件 |
智能内容识别
工具会自动跳过以下内容,避免误翻译:
- 品牌名/专有名词(可自定义配置)
- 文件路径(如 assets/images/logo.png)
- 图标类名(如 material-symbols-outlined)
- HTML注释和脚本内容
自定义翻译规则
创建 `custom.txt` 文件实现个性化配置:
# 完全跳过(不收集、不翻译、不替换)
Fila
GitHub
API
# 自定义翻译(收集、使用指定翻译、替换)
fila=aaa
dashboard=控制面板
hello=你好
性能优化
✨ 文件优先策略:采用文件→词的优化策略,处理速度提升280倍。I/O操作从109,280次减少到390次。