智能修复翻译后HTML文件中多余的标签,使用LCS算法对比基准文件和目标文件,自动删除多余的闭合标签。
这是一个用于修复翻译后HTML文件中多余标签的自动化工具。该工具以原始文件夹(www0)为基准,自动检测并删除目标文件夹(www)中翻译后多出的HTML闭合标签,如多余的 `< /select>`、`< /div>` 等标签。
脚本使用正则表达式提取HTML文件中的所有标签:
将基准与目标两侧的标签流统一抽取为令牌序列(例如 `open:div`、`close:div`,忽略自闭合标签):
<div class="form-floating">
<select id="floatingSelect6" class="form-select">
</select> <!-- 提前闭合(错误) -->
<option>数学</option>
<option>英语</option>
</select>
</div>
修复后(正确):
<div class="form-floating">
<select id="floatingSelect6" class="form-select">
<option>数学</option>
<option>英语</option>
</select>
</div>
日志文件采用标准JSON格式,记录每个文件中被删除标签的行号:
{
"add-course.html": [1609],
"dashboard.html": [156, 289],
"settings.html": [45, 78, 234]
}