HelloWorld怎么添加自定义术语

在 HelloWorld 中添加自定义术语,先到“术语库/词表”模块新建或批量导入(CSV/TBX/Excel),为每条填写源语、目标语、词性、上下文与备注,设置优先级、匹配规则与适用项目,然后保存并同步到翻译记忆与机器翻译引擎;必要时使用团队权限、版本控制与回滚功能保证稳定性。

HelloWorld怎么添加自定义术语

HelloWorld怎么添加自定义术语

先把概念讲清楚:什么是“自定义术语”以及它为什么重要

很多人一开始会把术语当成“词典里的词”,但其实术语(glossary/termbase)在翻译流程里扮演的是规则与约定的角色。它不仅是“源语→目标语”的映射,还包含使用场景、优先级、同义词、缩写、大小写规则等信息。把术语管理好,翻译的一致性、专业性和可维护性都会大幅提升。

你会从术语里得到什么好处

  • 一致性:同一概念在所有文档和渠道中使用同一译法。
  • 效率:机器翻译或人工翻译可以自动引用术语,减少重复校对。
  • 质量控制:术语可以设为强制匹配或提示,降低错译风险。
  • 跨团队协作:让营销、技术、法律团队共享统一翻译规范。

在 HelloWorld 里添加术语的基本流程(一步步来)

下面按从最常见的界面操作顺序来说明,想象你坐在电脑前,打开 HelloWorld:

1. 找到“术语库”或“词表”(Terminology/Glossary)模块

在主导航中通常会有“资源”、“资产”、“术语”或“词库”这种叫法。进入后会看到已有的词表列表、搜索/筛选与“新建/导入”按钮。

2. 新建词条(单条添加)

  • 点击“新建词条”或“添加术语”。
  • 填写最基本的字段:源语言(例如 en)、目标语言(例如 zh-CN)、源语条目目标语条目
  • 补充字段:词性(noun/verb)、上下文说明、示例句、缩写扩展、适用领域(如法律/医学/IT)、优先级或强制匹配开关、标签(tag)。
  • 保存:保存后该条会出现在列表并可被搜索。

3. 批量导入(CSV / TBX / Excel)

当术语量较大时,常用导入方式。大体步骤:

  • 准备文件:推荐使用 UTF-8 编码;常见格式 CSV、XLSX、TBX。TBX(TermBase eXchange)是术语行业标准,能带更多元数据;CSV 更简单易编辑。
  • 字段匹配:导入界面通常会让你把文件列对应到系统字段(source,target,context,pos,notes,priority,domain等)。
  • 冲突处理:选择覆盖、跳过或合并策略(系统会提示重复条目)。
  • 导入后审阅:即便是批量导入,也建议在小量样本上先试跑,确认编码、分隔符和字段映射无误。

术语字段(推荐的最小字段集)

以下是一个常见的术语条目字段说明表,导入与手动新建时都会用到:

字段 说明
source 源语条目(例如:authentication)
target 目标语译文(例如:身份验证)
lang_pair 语言对(en-zh-CN)
pos 词性(noun/verb/adjective 等,可选)
context 使用上下文或示例句,帮助判定准确译法
priority 优先级或是否强制(high/normal/low 或 boolean)
domain 适用领域(IT/Marketing/Legal)
notes 编辑备注或释义

示例:一个简单的 CSV 示例(表格形式表示)

source target lang_pair context priority
checkout 结账 en-zh-CN 电商流程中的“checkout button” high
session 会话 en-zh-CN 认证/登陆上下文 normal

匹配规则与优先级——让术语发挥作用的细节

术语好坏的差别常常在“匹配规则”。简单说,术语可以被系统按照不同策略匹配到翻译文本:

  • 精确匹配:仅当源语片段与术语完全一致时才替换,适合品牌词、专有名词。
  • 词形还原/大小写忽略:对英语动词或复数形式自动处理。
  • 前缀/后缀匹配:例如“login”可以匹配“login page”,需要谨慎配置以免误替换。
  • 上下文限定:只有当上下文标签或行业标签匹配时才生效,避免跨领域误用。

优先级与冲突

当有两个术语都能匹配时,系统会依据优先级或精确度决定。这也是为什么在建立术语时要设“优先级”和“适用域”。通常策略:

  • 强制匹配(highest)> 精确匹配(exact)> 模糊匹配(fuzzy)> 提示(suggestion)
  • 具体域(如 Legal)优先于通用域(General)
  • 人工审核后锁定的术语优先级高于临时导入的条目

如何让术语被机器翻译引擎与翻译记忆使用

添加术语只是第一步,关键是把术语同步给翻译引擎(MT)和翻译项目:

  • 在术语条目保存后,点击“同步到 MT”或系统会自动将术语表推送到内置/外部 MT(如自带模型或第三方 API)。
  • 在项目设置里启用“使用术语库”或选择特定的术语集。
  • 翻译记忆(TM)通常会依据术语优先替换匹配片段,并在回译或建议中显示术语来源。

API 与自动化操作(给技术团队看的要点)

如果你想把术语管理嵌入到 CI/CD 或本地工具链,HelloWorld 通常会提供 RESTful API。关键能力包括:

  • 创建/更新/删除单个术语的端点(POST/PUT/DELETE)
  • 批量导入/导出(上传 CSV/TBX)
  • 查询与过滤(按语言、域、优先级检索)
  • 同步触发(通知 MT 引擎或翻译项目重新加载术语)

示例(伪 JSON,表述在正文里):向 /api/terminology POST 一个 JSON 包含 source、target、lang_pair、context、priority,服务返回 200 与新条目 id。注意认证(API Key/OAuth),并遵循速率限制。

常见问题与排查(真实场景的坑)

  • 导入后看不到术语:检查字符编码(必须 UTF-8)、语言对列是否正确、导入映射是否错配。
  • 术语没有生效:确认项目是否启用术语库,MT 是否已同步,匹配规则(精确/大小写)是否合适。
  • 重复或冲突:使用合并策略或先导入到临时词表做查重,然后再合并到正式词库。
  • 格式问题:TBX 能携带更丰富元数据,但 CSV 更易被 Excel 编辑;导出/导入时注意字段一致。

最佳实践:怎么把术语库维护得既干净又好用

  • 小步快跑:先从核心词表开始(产品名、关键功能、品牌用语),逐步扩展。
  • 标签和域:用标签区分不同业务线(App、Web、Marketing),避免跨域污染。
  • 示例句与上下文:多写一句话上下文,能大幅降低误用概率。
  • 权限与审核:设置谁可以新增、谁需要审核;重要词条需要双人确认。
  • 版本控制与回滚:批量修改前先做快照;出现问题可以回滚到上一个版本。
  • QA 与监控:对生产翻译做抽样检查,统计术语使用率与违规替换以评估词表效果。

进阶功能:正则、短语匹配与词形规则

一些高级用例需要更灵活的匹配规则:

  • 正则匹配:例如把 phone( number)? 统一为“电话号码”。谨慎使用,测试覆盖面要广。
  • 短语优先:把常见短语单独做术语,避免词语逐个替换导致语义错乱。
  • 词形还原(lemmatization):对英语动词、复数处理,节省条目数量。

运维与团队治理要点(别忽视)

如果是企业级使用,建议关注这些管理点:

  • 定期清理未使用的条目,避免词库膨胀。
  • 建立“术语评审日”,每月或每季度由语言与业务专家共同审查。
  • 对敏感或法律相关术语设置更高的审核门槛。
  • 做好备份与导出策略(周期性导出 TBX/CSV),以防数据丢失或供应商切换。

举例说明:一个完整的工作流(从创建到上线)

  • 产品经理在本地 Excel 建立初始词表(30 条),保存为 UTF-8 CSV。
  • 术语管理员在 HelloWorld 的“术语库”做小规模试导入(5 条),检查映射和编码。
  • 确认无误后批量导入其余 25 条,设置 domain 为 “Product” 并把 priority 设为 high。
  • 同步到 MT 引擎,开启项目“使用术语”选项。
  • 翻译团队在 CAT 工具或 HelloWorld 在线编辑器中工作,术语自动高亮并建议替换,审校时锁定关键条目。
  • 上线后一周抽样 QA,发现两个术语在特定页面上下文不合适,修改并回滚调整策略,再次同步。

常见误区(顺便提醒一下)

  • 认为术语只是词典翻译——其实是一套约定与规则。
  • 把所有可能的词形都写成条目——太繁琐,建议使用词形规则或词形还原。
  • 导入就完事儿——导入后审校、同步、监控缺一不可。

最后的一点小贴士(实用、易被忽视)

导入前做一份“样本导入+回测”:随机抽取 20—50 个常见的句子,把术语在真实上下文中测试一遍,看看是否会出现误替换或漏替换。别忘了把语言代码按 ISO 639-1 / BCP 47 规范填好(例如 zh-CN、en-US),避免语言标识不一致导致的条目“看不见”。

说到这里,我突然想到,很多团队在初期太想一次性把所有术语都放进去,结果后来更新维护困难。一步一步来,保持语料与业务的同步,比一次性堆砌要实在得多。就像整理书架,先把常看的放在手边,别把旧报纸都塞满整排。