流畅性陷阱:翻译变免费了,但核验没有

今晚某个地方,有人会拿着一张他能完美阅读、不该信任的纸离开医院。
纸张看起来会很合适。干净的排版,医院的标志在角落,句子按语法顺序排列,用读者自己的语言排列。它会在不到一秒钟内完成,成本几乎为零,由一个连字都看不懂的临床医生递给一个无法与任何内容比较的患者。每个人都会相信这份文件是完整的,因为它看起来完整,而看起来完整正是这项技术完美无缺的地方。
我们知道这些文件可能包含什么,因为研究人员已经核实过。2021年,加州大学洛杉矶分校的Breena Taira领导的团队收集了二十份常用的急诊出院陈述,用谷歌翻译翻译成七种广泛使用的语言,并请母语者评估结果。他们在《普通内科医学杂志》上的论文包含了两项发现,本应终结关于临床环境中无监督机器翻译的争论。第一个是统计学上的。第二个是两个词:在亚美尼亚语输出中,布洛芬被译为“反坦克导弹”,而在中文中,抗凝药的Coumadin被译为“大豆”。
这些都不是微妙的失败。双语读者能立刻发现。问题是,没有双语读者会去看,因为这项工作的经济意义就是避免支付费用。
这就是它的形状。大约三年时间里,翻译成本下降了近三个数量级。查明翻译是否正确的成本没有变化,因为验证仍然需要一个能读两种语言、坐下来面对两种文件并思考的人。一代崩溃了。验证没有崩溃。接下来的一切,从一个价值700亿美元的产业重组,到当指令错误时谁应负责的问题,都源自这种单一的不对称。
那个只向一个方向破碎的算术
谷歌的云翻译服务将标准神经机器翻译定价为每百万字符二十美元,每月前五十万美元免费。DeepL的专业界面价格约为每百万字符五百五十美元。一千字英文大约相当于六千字符,因此翻译费用最高约十二美分,最低约三美分。2026年,专业人工翻译同一千字的费用约为一百五十至三百美元,费率调查显示人类作品每词汇费介于十至三十美分之间。
生成实际上是免费的。但考虑验证的要求,画面就会颠倒。要判断一千字的翻译是否正确,合格的双语读者必须阅读源文,阅读目标,并比较它们的含义、语域、省略、添加和否定。这并不比翻译快。通常更慢,因为审稿人必须重建译者的推理和作者的推理。而且这正好需要机器被购买以替代的稀缺人力。
验证成本现在比生产高出大约一千倍。如果工厂能以十分之一美分给零件盖章,但每个测试成本一百美元,没人会说测试是可选的。他们会重新设计工艺,或者公开承认他们运输的是未经测试的零件。翻译选择了第三种选项,从未写入:运输未经测试的零件,却表现得好像经过测试,因为它们看起来和测试过的零件一模一样。
第二种稀缺性位于第一层之下。约束力不是金钱,而是有条件的双语关注。只有有限的人能胜任地审阅亚美尼亚语的退伍说明、提格里尼亚语的租赁通知或苗族的农药警告。机器翻译使需要审阅的文本量倍增,而审阅者群体却保持原状。瓶颈是人口,而非预算线。
无症状失败
这种不对称之所以存在,是因为其后果在交付时是看不见的。机器翻译不会像软件那样失败。它不会崩溃、不会返回错误代码、不会出现字符乱码或留空字段。它失败的原因是生成了一个结构良好的句子,而句子的含义与源代码不同。
典型例子来自2019年《JAMA内科医学》杂志上,Elaine Khoong、Eric Steinbrook、Cortlyn Brown和Alicia Fernandez通过谷歌翻译将647句话传达了100套急诊出院指示,翻译成西班牙语和中文。西班牙语句子中有8%,中文句子中有19%不准确。更重要的是,西班牙语句子中有2%,中文句子中有8%可能造成临床显著伤害。
其中一句英文写着:“等你有机会和肾脏医生沟通”。中文输出指示患者继续服用肾脏药,西班牙语也说了类似的说法。“Hold”在临床英语中意为“停止”。机器将其按常规的“保留”理解,生成流畅、语法完美的指令,指示你做与开药者意图相反的操作。在其他地方,“主动脉瘤”在西班牙语中变成了“主动脉的排空”。
这种模式不仅限于医院。2010年,Iman Sharif和Julia Tse在《儿科》杂志上研究了纽约药房实际使用的76种西班牙语处方标签,发现其中一半存在错误,其中包括臭名昭著的“once”一词在西班牙语中读作“十一”的错误。在移民程序中,志愿组织“响应危机翻译”的翻译于2023年告诉《世界其他地区》,普什图语和达里语的机器翻译正在腐蚀庇护申请,有案例中第一人称在个人叙述中单数为复数,导致个人迫害故事被解读为集体投诉。至少有一起阿富汗人申请因此类错误被拒绝。
这些模式中没有表面信号。否定反转的读法与保存的否定完全相同:相同长度、相同的终止、相同的寄存器、相同的机构包装。这正是机器翻译区别于几乎所有其他消费技术失败模式的原因。输出本身没有不可靠性的证据,而能揭示其可靠性的证据仅存在于接收者没有的文档中。
考虑这条链。临床医生无法阅读目标语言,认为系统已经完成了工作。授权引擎的机构看到的是整体质量评分,如果有的话。患者看到医院信头上的流利文字,认为如果没有被检查,它就不会被交出去。没有人同时持有比较的两半,表面完整性完成了所有验证工作。
相比之下,较早的失败模式更具启发性。1980年1月,一名18岁的威利·拉米雷斯昏迷地被送到佛罗里达急诊科。他的古巴家人说他是“intoxicado”,意为因吃了什么而生病。但这被理解为“醉酒”。拉米雷斯被当作药物过量治疗,他的小脑内出血两天未被诊断,导致四肢瘫痪;赔偿金估计在他一生中约为七千一百万美元。这种失败有具体地点:一个房间、一个判决、一个被告。当同样错误来自电子病历中自动调用的引擎时,根本没有具体位置。
一个产品内有39个百分点的差距
平良研究的统计结果应当让所有相信机器翻译已被解决的人感到担忧。在七种语言中,整体意义在82.5%的案例中存活,即400个案例中的330个。这个标题毫无意义,因为它背后的差异极其巨大。
西班牙语准确率为94%。他加禄语为90%。韩语为82.5。中文为81.7。越南语为77.5。波斯语为67.5。亚美尼亚语为55%。在同一产品内,通过单一界面,并附带一套期望,最佳与最差之间存在39个百分点的差距。波斯语还有一个问题:没有准确度指标的捕捉:方向性文本处理使部分内容难以辨认。
界面中没有任何信息传达这种传播。菜单中显示亚美尼亚语和西班牙语为等效选项,输出速度、格式和没有任何附加条件。启用自动出院翻译的管理员并不是在可靠服务和不可靠服务之间做选择。他们同时启用了两者,却没有信号显示哪些患者能接受哪个。
这就是语言层级的不平等,并且映射到每种语言的数字足迹上。拥有庞大平行语料库的语言表现良好;而那些主要由从未成为有利可图本地化市场的人群使用的语言表现不佳。因此,最有可能获得不可靠翻译的患者,往往是最不可能有替代方案的:新移民、较小的侨民社区、当地医疗系统凌晨三点没有值班口译员的语言使用者。
差距并未缩小,因为进展集中在数据所在之处。2026年1月,贝斯以色列执事医疗中心团队在JMIR形成研究中测试了《克劳德十四行诗3.5》中紧急出院指示的西班牙语翻译,结果临床上基本可接受,评估者给出完整性和严重程度评分为5.0(满分五分制),意义为4.9。这确实令人印象深刻,也是关于西班牙语的成果。它也不再孤立,这也是该论点中发生变化的部分。与此同时,2025年9月,伊万·洛佩兹、大卫·维拉斯奎兹、乔纳森·陈和豪尔赫·罗德里格斯在《npj数字医学》上发表了一篇框架论文,建议优先部署在数字资源丰富的语言中,命名西班牙语和葡萄牙语,并警告称克丘亚语和约鲁巴语等代表性不足的语言需要先进一步测试。作者们说得对。但请注意这意味着:最先验证的语言最不需要验证,而风险最高的语言则是最后被服务的,甚至根本没有验证。
本案最有力的反驳证据出现在2026年《学术急诊医学》期刊上,应当充分陈述,而非受限提交。Giovanni Rodriguez、Patricia Hernández及其同事对53份真实急诊出院指令进行了盲测非劣质研究,这些指令字数介于100至500词之间,严格按照临床医生原写的字数,保留了原始拼写和语法错误。谷歌翻译和ChatGPT-4o将它们翻译成西班牙语、巴西葡萄牙语和简体中文,而专业翻译则是同一文本。专业医疗口译员被盲对待了哪些内容,获得了477个独特翻译的流利度、充分性、含义和严重性评分,且非劣势率差距为半分。
两台机器在大多数领域均不逊于专业人士。在西班牙语和巴西葡萄牙语中,它们在充分性、含义和严重程度上与专业翻译匹配,仅在流利度上有所不足。在简体中文中,它们在四项方面均匹配。临床显著错误的频率在翻译方法间无显著差异。
这一点必须无条件承认,因为这是真实且重要的。在这三种语言中,面对真正杂乱的临床医生撰写的原始文本,而非整齐的研究文笔,当前的机器翻译并不比专业人类更危险。之前引用的2019年和2021年数据是真实的,且它们测试的系统是真实的,但那些系统是两代前的。现在没人应该引用8%西班牙语不准确率来描述现代发动机对西班牙排放表的影响。事实并非如此。
但这项研究未能挽救它似乎要摧毁的地位,这两点原因在它自身的设计中都很明显。先从语言说起。西班牙语、巴西葡萄牙语和简体中文是全球最大的本地化市场之一,也是资源最丰富的对。研究对亚美尼亚语(55%)、波斯语(67.5%),或任何从未值得建立语料库的语言,毫无提及。它没有缩小39个百分点的差距。它仔细测量了一项研究后的峰值。
第二个原因涉及非劣势性所确立的事实。临床显著错误在不同翻译方法之间没有差异,并不意味着机器翻译是安全的。而是发现专业人工翻译同样具有临床显著的错误率,且机器与之平行。任何委托专业翻译相关文件的人都不认为单次翻译就足够,这也是该行业设有审查阶段、描述标准及其背后赔偿的原因。该研究的两部分内容随后由受过培训的评估员阅读。每一项翻译都进行了核对。这里的主题是那份根本没人检查的文件,且对未经验证的人类基线的非劣等性并不作为跳过验证的理由。它将论点从来源转向验证,而验证正是它应在的领域。问题从来不是机器还是人生成文本。关键是有没有人事后读过。
这两方面都有直接证据,来自一项测量非劣势设计遗漏内容的研究。2025年10月,在npj数字医学项目中,Ryan Brewster和一个大型多学科团队将儿科出院指导翻译成六种语言:阿拉伯语、亚美尼亚语、孟加州语、简体中文、索马里语和西班牙语,并比较了三种路径:单独使用ChatGPT-4o、专业语言学家翻译,以及“人机”流程(即由专业语言学家后期编辑的机器草稿)。42名评估员对输出进行了评分,其中包括12名专业语言学家、16名临床医生和14名双语家庭护理人员。
在前沿模型中,这一层级差距依然存在。对于西班牙语和孟加拉语,ChatGPT-4o接近专业水平。亚美尼亚语整体质量得分为2.4,专业翻译为3.6,在五分制中差距超过一分,索马里语和简体中文也明显低于专业标准。无论自2021年以来解决了什么,这一点都没有。请注意,两项研究在中文方面存在分歧,在一个领域各领域均不劣,而在另一个领域则明显低于专业标准,且在不同文档类型和不同评估者评判的不同比较标准下,相隔一年。这种分歧并非丑闻。它只是衡量证据薄弱程度的衡量。
另一个发现正是这场争论的核心。人机参与不仅拯救了亚美尼亚语,还击败了专业人士,得分3.9,而专业翻译仅3.6。在六种语言中,它也是更快的路径,平均每份文档7.1分钟,而专业翻译则为16.8分钟。后期编辑机器草稿比单纯这两种方式都好,且大约是从零开始翻译的两倍。这就是工作本身的样子,值得精确地说明其成本。这仍然需要合格的双语读者。它让那个人更快。但这并不意味着他们变得多余。
每一项此类研究本身就是一种验证行为,并承继了相同的成本结构。Beth Israel验证了一对语言、一种文档类型、一个机构,这对亚美尼亚语、同意书或下季度的模型更新一无所知。证据基础是以人类速度构建,部署表面以机器速度扩展。
那些看不清重要错误的工具
显而易见的做法是自动化检查。如果机器能产出翻译,机器当然也能给它进行评分。这就是质量估算的承诺,也是大多数企业部署在将部分分段路由以审核、允许其他部分通过时所依赖的。
2026年的两项研究表明,这种希望恰恰被错误地放在了关键位置。8月,Serge Gladkoff、Angelika Vaasa、Sue Ellen Wright、Ingemar Strandvik和Lifen Han发表了一篇同行评审论文《Looking under the Wrong Lampport》,该论文被9月第九届自然语言与语音处理国际会议录取,论证自动质量估算存在结构性而非偶然限制。他们的结论异常直白:分段级评分不应作为生产中路由、发布或评审绕过的单独依据。他们记录了过度拟合、分布崩溃、未能跨域泛化以及对内聚和一致性的盲目,这些根本不是单个分段的特性。他们提出的方向不是提高评分,而是让人工审核更便宜,而不是假装它没有必要。
临床版本早于两个月发布。在美国医学信息学会2026年6月的Amplify会议上,William Mundo、Elizabeth Goldberg和Yanjun Gao发表了人工智能生成的紧急出院指示翻译工作,发现自动评估与临床医生判断之间存在直接分歧。自动化指标显示出高质量。临床医生发现了准确涉及临床后果的意义敏感领域错误:错误翻译的用药指示、遗漏的退货注意事项、“随食服用”类的否定错误、每日与每日两次的混淆、轻微不适转化为严重疼痛。他们得出结论,仅靠自动化指标不应推动部署。
合在一起读,逃生路径就关闭了。自动估计错误的错误类别不是随机抽样。它更像是反转指令、取消警告和改变剂量的类别,因为这些错误对训练过奖励流畅度的系统来说是小的、局部的、流畅的,且是隐形的。评分机制最擅长捕捉人类能瞬间发现的错误,而最差的是只有人类才能发现的错误。你无法用产生问题的能力构建一个验证层。
市场如何利用这些节省开支
想了解当商品变得免费时价值的去向,请阅读2026年Nimdzi 100榜单,这是全球最大语言产业供应商的年度排名。该榜单将市场规模定为726亿美元,并公布的增长数据如同分层图。
前100家最大服务商整体增长1.1%。前十名增长3.6%。排名第51至第100位的服务商收缩4.3%,这是自2021年以来任何细分领域首次出现负增长。10家前一年未进入排名的服务商进入排名,主要通过收购;Propio Language Services通过收购口译公司CyraCom跃升至第三名。根据Nimdzi自身的信心评级,行业乐观情绪从6.5降至6.2。
这种分销是市场的标志,而商品已经转移到机器上。如果你卖大量翻译,你的产品就要和每千字十二美分的价格竞争,而没有任何成本基础能比得上这个。如果你卖验证、责任、领域专业知识、认证以及文件背后附上名称和赔偿政策的能力,你卖的是机器做不到的那种东西。中间的合同,因为中间的销售变成了免费的东西。
从行业内部看,同样的重组结果却有所不同。2026年6月,王宇俊、Ehud Reiter、潘世美、Steffen Eger和赵伟提交给arXiv的一项研究分析了2019年至2025年间来自Reddit、Facebook、Bluesky和Mastodon的79,286条社交媒体帖子,涵盖四个利益相关群体。翻译者讨论的弧线通过三个数据点讲述了故事。2021年他们讨论的是计算机辅助翻译基础设施、翻译记忆和术语库。到2023年,他们开始将人工智能整合进这些工作流程。到2025年,转向自动化和质量保证,也就是说他们停止讨论如何翻译,转而讨论如何检查机器。翻译者持着所有群体中最批判的立场。社区甚至没有争论同样的变量:开发者把可靠性框定为幻觉率,其他人则把它框定为验证和监督。
职业后果是职位描述被颠倒,且未重新协商。译者越来越多地被雇佣,而非产出文本,而是验证文本,这是认知要求更高的部分,且按后期编辑标准支付,假设机器已完成大部分工作。标准基础设施即使在市场中也认同not. ISO 17100涵盖人工翻译服务;ISO 18587涵盖机器输出的后期编辑,要求后期编辑达到ISO 17100下译者相同的能力水平。能力相同,薪酬等级不同,对阅读输出量的假设不同。
没人能决定这件事
这次迁移最引人注目的特点是,几乎找不到批准该法案的会议记录。
组织没有召开风险委员会,按语言评估错误率,定义超过人工审核的门槛,也没有批准。他们启用了一项功能。内容管理系统提供自动本地化;支持平台增加了翻译按钮。每月免费覆盖前50万字符,足以翻译一个小型组织的全部公开文档,无需产生需要签名的发票。
DeepL委托并于2026年报告的研究发现,企业在大量投资语言人工智能的同时,仍通过手动、未整合的工作流程运行关键的全球运营,这告诉你采用模式不是战略,而是分散的本地决策。营销文案、支持文档、产品列表、内部政策、合同摘要和面向患者的说明,在不同时间点跨越同一门槛,由不同人员授权,没有人被要求考虑整体。一个没人决定构建的系统,也没人觉得自己负责。
那条链条,每个人都是旁观者
在具体案件中试图确定责任方,这个过程就像蒸发一样。
患者出院时,机器翻译的指示中包含了反向用药方向。模范提供者是否承担责任?其条款否认高风险使用,且从未知道文本是临床内容。病历供应商?它应客户要求整合了一项服务。医院?可以说是的,是最有前景的讨论线索,但它会指出无法审查所有语言的每一份文件,也没有任何监管指示告诉其该界线的位置。临床医生不会阅读亚美尼亚语。患者收到医院寄来的本国语言文件并正确阅读。但该文件是错误的。
偶尔,机构拒绝接受这种传播。2018年6月,堪萨斯州联邦地区法院在“美国诉克鲁兹-萨莫拉案”中排除证据,该案中一名警官使用巡逻车笔记本电脑的谷歌翻译,从一名英语极少的司机那里获得搜查车辆的同意。该警官输入了“我可以搜查车辆吗?”西班牙语输出的翻译回来,更接近“我能找到这辆车吗?”的问题。法院认定,这种字面但无意义的表达意味着司机没有给予明确同意。法院认为责任在于选择部署该技术的一方,而非接收该技术输出的人。
Cruz-Zamora之所以具有启发性,正是因为它的特殊性。它需要对抗性程序、辩护律师、反向翻译以及愿意检查机制的法官。几乎没有机器翻译的文件能得到这种处理。绝大多数文件出现在没有对手、也没有人需要核查的情况下:解除协议、福利信、租赁通知、警告标签、同意书。错误(如果有的话)仅通过它造成的伤害显现,而由此回溯到误译条款的链条几乎无法重建。
行业销售专业赔偿保险正是因为翻译在专业人士完成时承担可转让责任。在ISO 17100下工作的指定译者是可投保的,因为责任方可被识别。而内容流水线中的范例调用则不然,风险在变得不可投保时也不会消失。风险转移给持有论文的人。
该定律同时指向两个方向
作为监管不连贯的案例研究,可以考虑美国当前对语言访问的立场。
《平价医疗法案》第1557条的最终实施规则于2024年7月5日生效,要求受保护的健康实体提供合格的口译和翻译,并特别要求在准确性至关重要或来源复杂或技术性时,必须由合格的人工翻译员审核机器翻译材料。这直接解决了核查漏洞:你可以使用机器,但在关键时刻不可无监督。
八个月后,即2025年3月1日,第14224号行政命令将英语指定为美国官方语言,并撤销了2000年要求联邦机构为英语能力有限者规划有意义访问权的第13166号行政命令。该命令指示司法部长撤销根据该指导发布的指导意见,随后司法部于2025年7月14日发布备忘录,鼓励各机构撤销自身指导,考虑仅提供英语服务,并明确利用人工智能降低翻译成本。2026年7月,《联邦公报》上正式发布了第六章语言访问指导的撤销通知。
政策环境现在同时要求对医疗环境中的机器翻译进行人工审查,并建议将机器翻译作为联邦项目的降低成本策略。基本的民权法律未曾改变:第六章仍禁止国籍歧视,联邦资金的接受者仍欠有实质性访问权。改变的是指导如何进行,因此当翻译由机器生成时,什么是有意义的访问,没有人有权回答。
欧洲的失败则有不同的质感。自2024年12月13日起生效的《通用产品安全条例》要求产品附带使用在销售国消费者易于理解的语言的说明和安全信息。这是一项结果要求,通常比流程要求更为可取。但对于翻译如何生成以及谁需要核实文本是否被理解而不仅仅是存在,则并未说明。通过机器翻译的警告推翻了禁止令,既满足了正式要求,也违背了其初衷。欧盟《人工智能法》自2026年8月起增加了透明度义务,包括对合成内容进行机器可读的标记,尽管翻译引擎在患者指令上运行是否属于其高风险范畴,仍由律师判断,而非既定事实。这里埋藏了一个小笑话:一些广泛被查阅的在线参考版本中,AI法案本身的条文附带通知,说明这些翻译是机器生成的,而非欧洲议会官方版本。
在英国,NHS英格兰于2025年5月27日发布了一项社区语言翻译与口译改进框架,对这一差距异常坦诚。该框架记录了NHS每年约7550万英镑的支出,而实际需求估计为2.5亿至3亿英镑,并警告称翻译应用虽便利,但存在准确性和患者安全的风险。该协议承诺NHS英格兰遵循国家指导,明确何时适合人工智能,哪些工具获批,如何跨语言验证准确性,以及包括赔偿和责任在内的治理框架。最后一条是承认:当人工智能翻译伤害NHS患者时,责任归谁?这条条款正在制定中,而工具已经进入病房。
实际被授予的收件人是哪些
剥开体制框架,直截了当地回答第一个问题。以极低的人力成本接收到机器翻译的信息,且没有人会同时核实两种语言,这意味着什么?
这意味着被递给一份带有完整社会信号、带有制度保障、却毫无实质内容的文件。那页上的每一个提示——信头、格式、流利度——都是在一个用语言写作需要懂得该语言的人的世界里演变出来的。这些提示之所以可靠,是因为它们成本高昂。流利是能力的代价高昂的信号。机器翻译让流利变得免费,所以信号什么都传达不了,也没人告诉接收者。
这通常针对普通接受者,很容易被当作居高临下地否定:当然患者无法判断,他们不是翻译员。但非劣势性研究在没有预设前提的情况下测试了这一说法。其盲测评估者是专业的医疗口译员,用自己的工作语言阅读,受雇评估翻译质量,并且知道他们所读的内容中有些是机器输出。他们经常将机器翻译用于专业工作。如果信号在这些条件下停止传递信息,对于这些读者来说,就没有哪个版本能让患者在走廊上阅读出院单时仍能传递信息。流利度并不是人类能力的薄弱证据。它根本不是证据。
这意味着认知风险已转嫁给最无能力承担的一方。此前,确保文本准确性的责任由机构承担,因为机构雇佣了翻译员。而现在则悄然转移到了读者手中,读者被期望(无需告知)将官方文件视为其母语的临时文件。这些读者往往是资源最少寻求第二意见的人。
这意味着知情同意正在悄悄被掏空。同意需要理解准确的信息。一个完全理解流利指令且反转了来源的患者,理解了某些内容,但不是他们应同意的内容。他们的签名证明了一份机构内部无人阅读的文件。
这意味着我们建立了一个两级的信息公民体系,虽然我们没有选择。说一种高资源语言,机器就能以接近专业的水准服务你。说亚美尼亚语,使用相同的界面、相同的按钮、相同的制度承诺,在受控测试中,准确度略高于一半。两人都被告知他们已经获得了自己的语言信息。只有其中一人得到了。
一个真正会咬人的问责制度
第二个问题比较难。 当生成翻译的系统比任何可用的系统都更有能力判断其是否有效时,谁承担责任?
诚实的出发点是没有任何技术修复可以解决这个问题。 验证差距不是不成熟模型的产物,而是任务的结构属性,其正确性只能由掌握两种语言的人来评估。 更好的模型会缩小错误率。 他们不会创建审稿人。 因此,该制度必须建立在责任分配的基础上,而不是工程设计的基础上,首先要扭转当前的违约状况。
该默认值应该很简单。 发布翻译文档的组织会保证这一点,无论它是如何制作的。 不是模型提供者,不是平台,不是临床医生,更不是接受者。 如果一家医院向患者提供亚美尼亚语的出院单,那么它就站在该单的后面,就像工作人员翻译写的一样。这条规则完成了大部分工作,因为它将未经验证的翻译成本归咎于获得节省的一方,而不是承担风险的接收者。
其余的如下。风险分层应按后果类别而不是文档类型进行组织。 营销标题和剂量说明都是文字;只有一个人可以将某人送入重症监护室。 可以改变医疗行为、改变法律义务、丧失权利或带有安全警告的内容属于在发布前需要由指定专业人士进行独立双语审查的级别。 其他一切都可以在未经验证的情况下运行,只要它有这样的标签。
每个语言的性能披露应该是强制性的并且在界面中可见。 如果产品在一种语言中的性能达到 94%,而在另一种语言中的性能达到 55%,则不应将它们呈现为等效的菜单选项。 受监管环境中的部署者应发布其自己内容域的特定于语言的错误率,并由合格的审阅者进行采样,并暂停低于定义下限的对的自动发布。 Lopez 框架推荐医疗保健版本:将联合委员会的监督范围扩大到机器辅助翻译,建立共享的临床翻译语料库,并使用特定于语言的基准更新第 1557 节指南。 特定语言是最重要的短语,因为总体准确性掩盖了重要的不平等。
出处标签应以目标语言出现在文档中,并以收件人可以采取行动的方式进行。 不是八点式的免责声明,而是简单的声明:此文本是自动生成的,未经阅读两种语言的人检查;如果此处有任何与您的药物有关的信息,请联系我们。伤害机制是对人类作者身份的错误印象,而标签是最便宜的平衡手段。
采购是最直接可用的杠杆。 受监管环境中的合同应指定 ISO 18587 完整后期编辑作为承担后果的内容的底线,指定负责的审阅者,要求足够的日志记录以重建哪个引擎在哪个日期生成哪个文档,并禁止依赖自动质量评估作为绕过审阅的唯一依据。 格拉德科夫的论文为最后一个条款提供了证据基础。 布鲁斯特的结果给出了第一个条款:完整的译后编辑不是速度和安全性之间的妥协,但比单独的任何一条路线都要好,并且比从头开始委托翻译更快。 翻译中昂贵的部分不再是翻译。 这就是阅读。
最后还有一个公共物品问题,没有一个组织能够解决。 由于缺乏高质量的并行数据,亚美尼亚的表现只有 55%,而这种短缺之所以持续存在,是因为没有人有商业动机来解决这个问题。在错误最危险的领域为资源匮乏的语言建立开放的、特定领域的语料库、临床说明、法律声明、安全警告,是卫生系统、监管机构和标准机构应共同资助的乏味基础设施。 相对于它可以避免的诉讼来说,它的成本很低,而且是唯一可以缩小层级差距而不是记录层级差距的干预措施。
所有这些都无法恢复旧的平衡,即生成翻译和信任翻译的成本大致相同。 相反,可行的制度所做的是使剩余风险可见、定价并拥有,以便选择发布未经验证的翻译的组织以书面形式明确做出选择,并附上其名称。
读起来完美但表达相反的句子
返回到开始此操作的指令。 保留肾脏药物,直到您有机会与您的肾脏医生交谈。 在源代码中,这是一个止损单。 在输出中,用世界上使用最广泛的两种语言,它变成了一个连续的顺序,在散文中如此自然,以至于母语人士没有理由质疑它。
这句话是整个问题的缩影,它解释了为什么故障模式如此难以认真对待。 我们对文本质量的每一个直觉都是在一个不再适用的假设下形成的:一种语言的流畅、适合上下文的散文意味着涉及该语言的有能力的人。 对于整个写作史来说,这是一个可靠的推论。 大约三年前它就变成了错误,我们的制度设计还没有跟上。
转向机器输出的组织并没有做出任何明显鲁莽的事情。 每个决策看起来都像是直接的效率提升,而且汇总结果从来都不是由任何人汇总的。 接收文件的人也并不粗心。考虑到每一个可用的信号,他们能够正确地阅读并适当地信任。 这些模型没有出现故障。 它们能够很好地执行其设计任务,以至于链条中的任何人都无法检测到残余故障。
这就是它成为陷阱而不是丑闻的原因。 没有人会从自己的角度做出不合理的行为,而且整个系统所产生的结果,如果他们能看到的话,没人会捍卫。 这项技术已经变得足够强大,以至于它在使用时是否有效的问题无法回答,而我们的回应是不询问。 这种差距不会自行缩小,因为便宜的东西会变得越来越便宜,而昂贵的东西会因为与技术无关的原因而变得昂贵。 我们控制的唯一变量是谁对差异负责。
目前答案是拿着纸的人,他不知道有一个问题。
来源和参考文献
- Breena R. Taira、Vanessa Kreger、Aristides Orue 和 Lisa C. Diamond,“对急诊科指示的谷歌翻译的实用评估”,《普通内科医学杂志》,2021 年 3 月 5 日: https://link.springer.com/article/10.1007/s11606-021-06666-z
- Elaine C. Khoong、Eric Steinbrook、Cortlyn Brown 和 Alicia Fernandez,“评估使用谷歌翻译翻译急诊室出院说明的西班牙语和中文”,《JAMA 内科学》,2019 年 2 月 25 日: https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2725080
- Giovanni Rodriguez、Patricia Hernández、Christopher Kirwan、Lisette Dunham 和 Sayon Dutta,“急诊科出院指示机器翻译准确性的比较评估:非劣效性研究”,学术急诊医学,第 33 卷,第 4 期,2026 年: https://onlinelibrary.wiley.com/doi/abs/10.1111/acem.70289
- Ryan CL Brewster 等人,“评估人工智能支持的患者出院指示翻译的人机交互策略:多学科分析”,npj Digital Medicine,2025 年 10 月 24 日: https://www.nature.com/articles/s41746-025-02055-6
- Nimdzi Insights,“2026 Nimdzi 100,”2026:https://www.nimdzi.com/nimdzi-100-2026/
- 王宇君、埃胡德·雷特、潘诗梅、斯特芬·艾格和赵伟,“超越准确性:关于机器翻译的社区观点,”arXiv:2606.09655,2026年6月8日:https://arxiv.org/abs/2606.09655
- Serge Gladkoff, Angelika Vaasa, Sue Ellen Wright, Ingemar Strandvik 和 Han Lifeng, “看错路灯:关于自动翻译质量评估的局限性,”arXiv:2608.03577, 2026年8月4日, 即将在第9届国际自然语言与语音处理会议(ICNLSP 2026)论文集中发表, 意大利特伦托, 2026年9月:https://arxiv.org/abs/2608.03577
- 科罗拉多大学安舒茨医学院园区,“研究人员研究人工智能生成的急诊科出院指示翻译中的安全风险,”2026年6月23日:https://news.cuanschutz.edu/dbmi/ai-generated-discharge-instructions
- Carreras Tartak 等人,《使用大型语言模型评估急诊科出院指导的西班牙语翻译:工具验证与可靠性研究》,JMIR 形成性研究,2026 年 1 月 12 日:https://formative.jmir.org/2026/1/e79676
- 伊万·洛佩兹、戴维·E·贝拉斯克斯、乔纳森·H·陈和乔尔赫·A·罗德里格斯,《在医疗保健中实现机器辅助翻译的操作化》,npj数字医学,2025年9月30日:https://pmc.ncbi.nlm.nih.gov/articles/PMC12485017/
- 盖尔·普莱斯-怀斯,《语言、文化与医疗悲剧:威利·拉米雷斯案》,《健康事务前沿》,2008年11月19日:https://www.healthaffairs.org/do/10.1377/forefront.20081119.000463/
- 伊曼·沙里夫 和 朱莉娅·谢,“计算机生成的西班牙语药品标签的准确性,”《儿科学》,2010年5月:https://pubmed.ncbi.nlm.nih.gov/20368321/
- 世界其他地区,“人工智能翻译危及阿富汗避难申请,”2023年9月19日:https://restofworld.org/2023/ai-translation-errors-afghan-refugees-asylum/
- TechCrunch,“法官称‘字面但无意义’的谷歌翻译并不等于对警方搜查的同意,”2018年6月15日:https://techcrunch.com/2018/06/15/judge-says-literal-but-nonsensical-google-translation-isnt-consent-for-police-search/
- 白宫,“指定英语为美国官方语言”,第14224号行政命令,2025年3月1日:https://www.whitehouse.gov/presidential-actions/2025/03/designating-english-as-the-official-language-of-the-united-states/
- 《联邦公报》,《关于第六章禁止影响有限英语能力者国籍歧视的联邦财政援助受益人指导撤销通知》,2026年7月14日:https://www.federalregister.gov/documents/2026/07/14/2026-14128/notice-of-rescission-of-guidance-to-federal-financial-assistance-recipients-regarding-title-vi
- 美国翻译协会,《平价医疗法案》第1557条及语言访问:谁、什么、如何“:https://www.atanet.org/client-assistance/blog-section-1557-of-the-affordable-care-act-and-language-access-who-what-how/
- 国际标准化组织,“ISO 18587:2017 翻译服务,机器翻译输出的后期编辑,要求”:https://www.iso.org/standard/62970.html
- TÜV SÜD,“ISO 17100 和 ISO 18587 认证、翻译质量及机器翻译标准”:https://www.tuvsud.com/en-us/services/auditing-and-system-certification/iso-17100
- 英格兰国民保健署,“改进框架:社区语言翻译与口译服务”,2025年5月27日:https://www.england.nhs.uk/long-read/improvement-framework-community-language-translation-and-interpreting-services/
- 欧盟-职业安全卫生管理局,《2023/988年条例》(关于一般产品安全),自2024年12月13日起适用:https://osha.europa.eu/en/legislation/directive/regulation-2023988eu-general-product-safety
- 欧盟人工智能法案,“第50条:某些人工智能系统提供者和部署者的透明度义务”:https://artificialintelligenceact.eu/article/50/
- Google Cloud,“云翻译定价”:https://cloud.google.com/translate/pricing
- 《人工智能杂志》,“尽管AI支出激增,人工翻译流程仍抑制企业压力,DeepL研究发现”,发表于2026年3月10日:https://aijourn.com/manual-translation-processes-still-stifling-enterprises-despite-surge-in-ai-spending-finds-deepl-research/
- 国家移民法律中心,“特朗普政府试图拆解语言访问并未抹去民权法”:https://www.nilc.org/articles/trump-administrations-attempts-to-dismantle-language-access-do-not-erase-civil-rights-law/

蒂姆·格林 英国系统理论家及独立技术作家
蒂姆探讨了人工智能、去中心化认知与后人类伦理的交汇点。他的研究发表于smarterarticles.co.uk挑战了主流技术进步叙事,同时提出了集体智慧和数字管理的跨学科框架。
他的文章曾在Ground News上发表,并被学术和技术界的独立研究人员分享。
奥尔西德: 0009-0002-0156-9795 电子邮件:tim@smarterarticles.co.uk
收听免费的每周节目SmarterArticles播客