*手语转文字系统中的自信型误译,以及无法察觉它的基准测试*
2026年9月9日,中国科技媒体量子位报道了vivo AI Lab提出的一种名为CAPO-SLT的方法,出自一篇题为《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》的论文,发布在同行评审期间论文所在的平台OpenReview上。它所指出的问题正是任何购买这项技术的人都应担忧的问题。一个翻译系统可能生成一句流畅、语法正确、看起来完全可信的话,却与手语者实际所打的内容毫无关联,而由于这句话读起来很顺畅,其中没有任何迹象会暴露这个错误。正如报道所述,一个局部看似合理却缺乏视觉依据支持的词,可能使整句翻译偏离方向,且错误会在整句话中不断累积。该方法根据前一策略的置信程度,逐词调整强化学习被允许更新模型的范围:置信度高时收紧边界,接近0.2;置信度低时放宽边界,最高到0.3,并对带有负优势值的词元施加额外上限。其目的是阻止模型固守自信的猜测,同时为不确定的猜测留出空间,使其能够被拉回到视觉证据所支持的方向。
报道中的结果比标题所暗示的要窄得多,而这一差异很重要。在中文基准测试CSL-Daily上,所报告的提升是相对于另外两个同样基于姿态输入的命名系统而言的:相较Geo-Sign约提升1.26个BLEU-4,相较Uni-Sign约提升3.07个BLEU-4,其说法是在仅使用姿态输入的系统中取得最佳成绩,而非在整个领域中最佳。在美国手语基准测试How2Sign上,报告的数字为41.4 BLEU-1、15.2 BLEU-4和34.9 ROUGE-L,相较Uni-Sign的提升约为一个点或更少。本分析未能读到论文原文,因为托管论文的仓库需要浏览器验证步骤,因此以下内容审视的是该研究所指出的问题、其所处理的翻译方向,以及所提供证据的类型,而非对该系统本身作出评估。这些内容本身就值得审视,因为这个问题是真实存在的,其所涉及的翻译方向恰恰是各机构处理最不谨慎的方向,而所提供的证据类型也无法证明它被要求证明的东西。
翻译方向为何
围绕手语人工智能的大多数公开争论,关注的是面向聋人的输出:发车时刻表上的手语虚拟形象、网站上的手语视频、教室里的机器人。而手语转文字的方向恰恰相反。输入是一位聋人在打手语,输出则是供其他所有人阅读的文字,这改变了“错误”的含义。当虚拟形象打得不好时,聋人得到的是一份糟糕的翻译,而且通常能察觉到有什么地方不对。而当手语转文字系统编造出一句流畅的话时,这位聋人所说的话就被替换成了他们从未说过的话,而这些话会被送到临床医生、个案工作者、调查人员或法庭记录员手中,这些人根本无从得知发生了什么。
这种不对称性正是治理层面的问题所在。房间里唯一能察觉这一错误的人,是其原意被替换的那个人,而这个人往往正是从未看到输出结果的那个人。以这种方式产生的文字并不会凭空消失:它会被打进接诊记录、陈述书、绩效评估或案卷之中。一旦进入这些文件,它便获得了正式记录的权威性,而不再只是机器翻译的状态,聋人必须去反驳一份声称在引用自己原话的文件。这个方向上的流畅型错误,并非一次访问便利措施的失败,而是一种归属认定,而各机构几乎没有任何机制来撤销这种认定。
该指标看不到失败
这一方法所报告的每一个数字,乃至几乎所有同类系统所报告的数字,都是BLEU或ROUGE。这两者的工作原理都是将机器输出与参考翻译进行比较,测量词序列的重合度。它们最初是为口语机器翻译设计的,衡量的是与参考文本的相似度,而这与忠实反映手语者所表达的内容并不是一回事。一句编造出来的话,只要恰好与参考文本共享常见措辞,就能得高分。而一句措辞不同但翻译正确的话,反而可能得低分。这一方法所要修复的失败模式——流畅却缺乏视觉证据支持的输出——恰恰正是这些指标最难以察觉的失败类型,因为流畅性正是这些指标所奖励的东西。
这并非来自该领域之外的批评。萨里大学视觉、语音与信号处理中心本月发布的一篇论文,对六个翻译系统进行了评估,得出结论称“BLEU-4分数的提升本身并不能证明手语理解能力的提升”,并指出这种低资源多模态设置“使模型得以利用虚假相关性和口语先验,而非学习更强的手语表征”。他们提出的替代协议检验的是段落内容是否得以保留,该协议重新排列了各系统的表现排名,揭示出一个BLEU-4根本无法察觉的差距。结合这一发现来看,BLEU-4分数的提升只能证明输出与参考文本更为相似,尚不能证明系统理解了手语内容,更不能证明自信型编造已经减少。
这里所报告的提升幅度本身也很重要。相较命名基准系统约一到三个BLEU-4点的提升,是普通的渐进式进步,而它们却被当作系统编造程度降低的证据来提出。结合萨里大学的发现来看,这正是整个论证中最薄弱的一环:在一个连该领域自身都承认无法反映手语理解能力的指标上,提升几个点,不足以证明自信型编造已经减少。这一说法或许仍然成立,但要证明它,需要用不同的检验方式,而这种证明理应能在论文中找到——只是这篇论文尚处于审稿阶段,并未正式发表。
置信度是训练信号,而非披露信息
从表面上看,这一方法最有意思的地方在于,它把模型自身的不确定性当作值得据以采取行动的信息。这种直觉是对的,它指向了采购方本该要求的东西,只是这一方法所提供的形式并不完全对路。用于训练内部的置信度值,改变的是模型的学习方式,它并不会传达给阅读输出结果的人,也不会改变模型不确定时输出结果的样子。系统依然会生成一句流畅的话,因为生成流畅的话正是它的本职工作。文本中没有任何地方表明其中三个词是猜测出来的。
有两件事可以改变这一点,而且都不难做到。第一是“弃权”机制:系统应当能够拒绝作答。一个能够表明“这段内容未能被清晰捕捉”并标记出空缺的手语转文字系统,要比一个总是给出完整句子的系统安全得多,因为可见的空缺会促使人工去补全,而流畅的编造却不会。第二是“暴露”机制:系统所具备的置信度,应当在使用环节可见,低置信度的片段应当在送达读者的文本中被标记出来。厂商所声称的95%准确率描述的只是一个平均值,而平均值无法告诉采购方剩余那5%究竟是什么性质。5%的噪声只是个麻烦;而5%的自信型编造,不可预测地散布在一份病史或证词之中,则完全是另一种产品——而大多数厂商所公布的那一个数字,根本无法区分这两者。
姿态输入能承载什么、不能承载什么
据报道,该系统基于姿态数据工作,也就是被追踪的身体关键点,而非原始视频。这确实带来了真实的隐私优势,因为关键点数据的可识别性远低于手语者面部的实拍画面,而在这样一个数据即是人体本身的领域里,这一点至关重要。但它也引出了一个若不读到论文原文便无法回答的问题:究竟是哪些关键点。手语的语法承载于面部之上。摇头可能会否定其所伴随的整句话,眉毛的位置可能标示出陈述句与疑问句的区别,口型则用来区分那些手部动作相同的手语词。如果关键点集合对面部的采样过于稀疏,系统可能在结构上根本无法察觉那些能够反转句意的特征,由此产生的失败正是流畅型的:手语者本是否定的意思,却输出一句干净利落的陈述句;或者手语者本是在提问,输出的却是一句陈述句。而在临床或法律场景中,一句话与其否定形式之间的差别,就是全部内容的差别。
基准测试不等于实际部署
CSL-Daily是一个在实验室环境中录制的中国手语语料库,内容涉及日常话题。How2Sign是一套大型的美国手语教学视频集合。二者都是严肃的研究资源,但都不代表机构实际使用手语转文字技术时的真实情况:一个处于疼痛之中的人,从病床上以摄像机原本未曾设计适应的角度打手语,使用地区性变体,一只手因插着输液导管而无法活动,时而被打断,情绪激动,或在不同语域之间切换。正因如此,报告中的How2Sign数字——15.2 BLEU-4——值得牢记。在这两个基准测试中相对更为开放领域的那一个上,在有利条件下,该领域现有水平所产生的输出,与人工参考翻译的重合度依然有限。这是一个合理的研究结果。但它不应成为任何依赖于记录聋人患者所说内容的依据。
采购方应当要求什么
由此可得出六项要求,它们均针对这一翻译方向而specific(特定)。第一是带有可见空缺的弃权机制,使不确定性以空缺的形式呈现,而非以散文的形式呈现。第二是在交付文本中标记置信度,让读者而非仅仅是模型能够获取这一信息。第三是在记录任何内容之前先向手语者进行回译,使聋人能够用自己的语言看到系统即将以他们的名义说出的内容,并有机会予以阻止。第四是记录中的来源标注:凡是源自机器翻译的文本,无论存储在何处,都应标明其来源,并保留原始出处,以便日后如有争议,争议的焦点是机器的输出,而不是当事人的可信度。
第五是能够触及记录本身、而非止步于厂商客服台的更正渠道,因为案卷中未被更正的一句话,其存续时间会远远长于任何一张工单。第六是与所声称成效相匹配的证据:采用检验内容是否得以保留的协议来衡量语义忠实度、针对否定句、疑问句和角色转换进行对抗性测试、按手语变体和拍摄条件进行分类统计,并由聋人手语者进行理解度核查,而非仅凭参考文本重合度来推断。NCG的立场是:所需证据的严格程度应随应用场景风险的提高而提高,而一个其错误会进入正式记录并被归于某人名下的系统,理应处于这一标准的顶端,而非中间位置。
这一说法是如何传入英语世界的
这里还有第二个故事,而它同样属于关于证据的这篇文章的一部分。量子位的报道来源可靠:它指名了该方法,描述了其运作方式,报告了相较于命名基准系统的提升幅度,并附上了论文链接。而当这一信息传到英语读者手中时,已经经过了一个署名为“AI编辑部”的网站,该网站自称是生成式引擎优化门户,意即其内容是为了被人工智能搜索工具检索和复述而撰写的,并且还会给自己的文章打质量分。那个版本删去了指向论文的链接,并将相对于特定基准系统所测得的提升,转换成了扁平化的绝对分数。这其中没有任何欺诈成分,它不过是一份摘要的摘要,经过优化以便被机器抓取,而它悄悄去掉的,正是通往证据本身的路径。
这一点值得特别指出,因为如今大多数采购官员正是通过这样的路径接触到关于这项技术的说法。一项厂商说法,首先作为投稿论文进入学术文献,继而被行业媒体准确报道,再被聚合平台改写以便于检索,然后被某个人工智能助手检索到,最终出现在一份简报中,数字被硬化为确凿的结论,引用来源却已消失不见。每一步单独来看都说得过去。而最终结果是一个没有分母、没有基准、也没有背后文献支撑的数字,却比原作者所声称的更为斩钉截铁地呈现出来。能够保护采购方的那种审慎态度,正是本文对这项技术所要求的同一种态度:把说法追溯回它的出处,并坦率说明哪些内容自己未能核实。
本分析的局限性
本文对CAPO-SLT的介绍,依据的是对这项工作进行报道的中文行业媒体报道,该报道指名了论文并附有链接。论文本身托管在一个需要浏览器验证步骤的平台上,本分析未能读到原文,因此文中所引用的数字均为转述而非核对原始文献所得,以上内容均不应被解读为对该系统或对vivo AI Lab的评估——该实验室所提出的问题方向是正确的,其方法也很可能确如其所言那样有效。本文的论证立足于该领域如今已公开指出的问题本身,以及他人已发表的、关于标准基准测试能够证明什么、不能证明什么的研究成果。NCG尚未对该系统应用任何自有工具进行评估,而本文更广泛的论点,也完全不依赖于这一种具体方法。
值得以令人鼓舞的一面作结,因为确实存在这样一面。一家商业研究实验室公开将自信型编造认定为手语转文字翻译中的核心缺陷,而非又一次报告渐进式的提升并对失败之处只字不提。这是对这一问题的诚实表述,而指出这个问题正是衡量它的前提。如今的风险则是那个熟悉的老问题:这一指认会被传播开来,修复措施会被想当然地假定已经到位,而某个机构中的某个人,会怀着“这个问题已经被一篇自己从未读过的论文解决了”的信念,把一句流畅的话打进某位聋人的档案之中。
资料来源
1. 量子位(经36氪转载),《CAPO-SLT在三项中文指标上取得最佳成绩》,报道vivo AI Lab的方法,2026年9月9日。https://36kr.com/p/3975775861813507
2. vivo AI Lab,《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》,OpenReview(审稿中;本分析未读取原文)。https://openreview.net/forum?id=l4bCsrSkYx
3. Zgeo(AI编辑部),对上述内容的改写报道,2026年9月9日。https://www.zgeo.com.cn/news/capo-slt-sign-language-translation-vivo-ai-lab
4. Oline Ranum、Edward Fish、Simon Hadfield 与 Richard Bowden,《Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks》,萨里大学(视觉、语音与信号处理中心),arXiv:2609.03734,2026年9月。https://arxiv.org/abs/2609.03734
5. 《RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation》,arXiv:2512.07273(报告了CSL-Daily无词汇标注结果)。https://arxiv.org/abs/2512.07273
