关于手语AI的讨论正让我越来越感到不安,这并非因为我认为技术不应继续发展。
令我担忧的是,人们正急于将AI手语虚拟人推崇为无障碍交流的未来,却回避了关于这些系统究竟是什么、如何运作、以及局限性从何开始的诚实讨论。
眼下,许多截然不同的技术正被贴上相同的标签混为一谈。在普通听人观众看来,在线演示中的一切看起来都差不多。屏幕上出现一个打手语的虚拟人,动作流畅,渲染精美,人们便开始议论纷纷,仿佛我们正在见证功能完备的AI翻译时代的到来。
但这些演示背后的真实情况往往复杂得多。
有些系统在幕后严重依赖人工。有些依赖预先编写好的脚本内容。有些是通过动作捕捉的表演转移到虚拟人身上。有些仍是在严格受控环境中运行的实验性技术。还有一些系统试图动态生成手语,却仍在一致性、语境理解和沟通可靠性方面举步维艰。
这些区别至关重要。
谁才真正有资格评判质量
问题在于,大多数听人利益相关者无法独立判断手语交流的质量。医院管理者、政府官员、学区、投资人或采购人员可能看了一场制作精良的演示后,仅凭虚拟人看起来逼真便认定交流是准确的。
与此同时,Deaf观众可能会立即察觉到语法、节奏、语境、面部表情或含义方面的问题,而这些是听人决策者自己无法看出来的。
这就造成了一种危险的失衡。
无障碍技术如今正进入交流失败会带来严重后果的领域。医疗、教育、交通、紧急通讯、心理健康服务、法律场合以及公共服务,都依赖准确且有意义的交流渠道。如果各机构开始认为视觉效果令人印象深刻的AI系统自动等同于合格的人工交流支持,那么最先承受后果的,绝不会是推广这项技术的公司。
而是Deaf人士。
如果各机构开始认为视觉效果令人印象深刻的AI系统自动等同于合格的人工交流支持,那么最先承受后果的,绝不会是推广这项技术的公司。
这些问题本不该引发争议
最令我沮丧的是,如今提出合理问题竟变得如此困难,稍有质疑便会被视为“反对创新”。
诸如以下这些问题:
- 这个系统是如何经过验证的?
- 谁参与了测试?
- 是否有母语手语使用者参与评估?
- 在真实对话而非脚本演示中,它的表现如何?
- 失效条件是什么?
- 紧急情况下会发生什么?
- 它如何为DeafBlind用户提供支持?
- 人工监督依然存在于哪些环节?
这些都不是恶意的问题。
这些正是在将系统部署到现实世界的无障碍交流环境之前,理应被提出的问题。
辅助工具,而非替代品
我并不是在主张AI在无障碍领域毫无用武之地。我认为技术完全可以在交流流程、字幕支持、协调工作以及某些低风险环境中提供帮助。但把技术当作辅助工具使用,与把尚未成熟的系统当作有意义的交流渠道的替代品,这二者之间存在着巨大的差别。
Deaf社区已经为“交流渠道是一项权利,而非便利”这一理念奋斗了数十年。这一理念不应因为新技术潮流的到来而突然消失。
缺乏透明度的创新,不过是营销。
缺乏问责的创新,只会带来风险。
而如果不诚实地讨论其局限性,创新很快就会演变成又一种情形:残障人士被期望容忍失败,而其他所有人则在远处为进步欢呼喝彩。

