Letters, briefs and reports can be shown with their own typography. Automatic keeps that only while none of your settings above ask otherwise.
Trends, analysis, and strategies for the modern rural economy.
The face is the data In spoken and written language technology, the training data and the person can usually be separated. A sentence can be stripped of its author. A voice can be transformed until the speaker is unrecognisable and…
Read NowThis article reads the same four incidents from the other chair. It sets out what is publicly known, separates fact from interpretation, and asks what a county, city, or school district already has in its contracts and procurement files that…
Read Now2026年9月26日 · Heather M. Grizzle,Novara Consulting Group 本记录存在的原因 2026年8月,Novara Consulting Group公开询问Signapse,该公司如何界定手语AI的适当使用限度,特别是在涉及聋人儿童的教育场景中。首席执行官Sally Chalk认同这一前提,并进一步阐述。她将法院、警察局、医院、社会服务机构和儿童保护会议也纳入这份清单,并主张:随着风险上升、准备时间减少,一项服务应当涉及更多的人工监督、更少的AI,甚至完全不使用AI。这正是买家希望从供应商那里听到的立场。本记录要问的问题由此而生:支撑这家公司的文件是否能够支持这一立场。 从书面材料来看,Signapse的起点确实比市场上大多数同行更为扎实。其发布的《AI治理框架》包含一项《使用政策》,按行业逐一区分哪些工作必须由人工完成、哪些可以由AI完成。在涉及健康、自由、法律权利或保护性事项的决策场合,该政策要求必须有合格的口译员或笔译员参与,并声明在大多数此类情况下Signapse会推荐另一家公司。保护性事项则毫无例外地保留给人工处理。该框架列出了一个聋人顾问委员会和一名聋人影响官,并列出了该公司咨询的聋人组织,包括RAD、BDA和Action Deafness。很少有手语AI提供商能发布可与之相媲美的内容。然而,框架阐述的只是公司打算如何行事。买家还需要能使这种行为具有可执行性的文件工具。这些工具包括:与那些其手语和反馈塑造了产品的聋人签订的协议、约束那些同时领导合作组织的董事的规则,以及一份涉及手语视频、肖像和训练数据的隐私政策。买家还需要公司所引用的每一个性能数据都有公开的来源。这种既定意图与具有约束力的文件之间的落差,正是NCG提问所指向的地方。 NCG审查了Signapse的《AI治理框架》、服务条款、隐私政策和ASL产品页面,并向该公司提出了七个问题。在发布之前,NCG将其对答复的理解发送给Signapse,并邀请其予以更正。Chalk女士于2026年9月17日回复,并于2026年9月24日两次回复,第二次回复时她称这是Signapse对本次评估的最终意见。Signapse回答了全部七个问题。它以书面形式承认了若干缺口,撤回了一个无法溯源的准确率数据,并为其提出的整改措施附上了具体日期。它在9月24日的第一次回复中改变了一周前给出的三项答案中的内容。当NCG询问哪一版说法准确时,该公司当天就对全部三项作出了澄清。其最终答复基本回到了9月17日的说法。 这种变化本身并非对Signapse的不利评价,本记录也不将其作为不利评价呈现。它说明了为什么买家不应把采购决策建立在往来信函之上。信函是私密的,可以被修改,而且它们是写给一位顾问的,而非写给将要承担部署风险的机构的。购买手语AI用于聋人服务的公共机构,需要的是可以阅读、引用并据以问责供应商的文件。因此,本记录列出了目前存在的内容、该公司承诺做出何种改变及其时限,以及其答复在两封信函之间是如何变化的。每一项陈述都标注了作出的日期。仅在措辞的确切内容至关重要时才引用回复原文。凡NCG查阅了公开网页的地方,均注明了查阅日期。 Signapse是NCG按照同一方法正在审查的多家手语AI提供商之一,该方法载于SLAT Index框架文件(https://www.slatindex.org/framework/)。 目前存在的内容 本节逐份文件记录当前状况。对每一项,均说明公开记录显示了什么、Signapse就此说了什么以及何时说的,并说明该问题为何对决定是否购买的机构而言至关重要。 服务条款。聋人反馈对Signapse的产品而言并非可有可无,而是产品得以纠正的方式。该公司的《翻译质量保证政策》描述了每月举行的用户小组会议,聋人参与者在会上审阅生成的翻译内容,并将与聋人组织的协商列为其外部审查手段之一。因此,规范这种反馈的条款至关重要。已发布的《服务条款》(https://www.signapse.ai/terms-of-service)最后更新于2023年10月1日,在2026年9月24日和26日查阅时均未变化,其规定:任何直接向Signapse发送“任何问题、评论、建议、想法、反馈或有关服务的其他信息”的人,均将其中的全部知识产权转让给该公司,该公司此后可“不经致谢或补偿”而使用这些内容。另有一条单独条款放弃了对同一材料的精神权利。将此条款与该公司自身的《宗旨》对照来看——后者称所采集的手语内容必须尊重“公平报酬和透明条款”——这一条款显得格格不入。Signapse对此给出了三种说法。9月17日,它将该条款描述为为商业客户拟定的标准格式条款,“并不反映我们与聋人社区贡献者的合作方式”,并表示付费参与者目前尚未纳入单独的书面协议。9月24日,它表示该条款仅适用于付费客户,反馈会议在平台之外进行,贡献者从不创建账户或接受该条款,因此该条款从未适用于他们。同日的最终信函又表示,客户条款不受10月工作的影响,该项工作反而是为反馈会议参与者创建一份标准书面协议。NCG不对该条款是否可能约束从未接受该条款的人发表意见。对买家而言,问题要更为具体:按该公司自己的说法,如今约束聋人贡献者的并非一份已发布的文件,而是一系列个别邮件往来,而旨在取代这些邮件的协议尚不存在。 贡献者报酬。Signapse报告了两种安排。对于其肖像出现在产品中的手语使用者,适用其《奖励与报酬政策》,即按使用其形象的每份合同或许可月度价值的1%支付报酬,按季度追溯支付,持续整个合同期限;若有多名手语使用者出现,则平均分配。反馈会议参与者每次参加会议可获得25美元,无论其反馈内容如何。两者之中,版税安排更为有力——它将手语使用者的收入与其肖像的商业存续期挂钩,而这一市场中鲜有提供商披露过任何类似的安排。该公司的《使用政策》还承诺,凡使用录制的真人手语使用者时,“必须取得知情同意并给予适当报酬”。困难之处在于文件记录而非原则本身。Signapse表示,目前不存在独立的贡献者合同:25美元的支付是通过电子邮件与每位参与者商定的,该往来邮件即为书面记录,支付情况记录在其支付记录中。该公司称这一做法自会议开始以来即是如此。这些记录属于私密材料,NCG未曾查阅。希望核实上述任一安排的买家,需要直接索取相关政策和记录。 利益冲突。Mark Wheatley是Signapse的董事,同时也是RAD的首席执行官,而RAD是Signapse治理框架中列名的合作伙伴之一。Craig Crowley曾在2022年8月至2024年3月期间担任Signapse董事,同时领导另一家列名合作伙伴Action Deafness,目前已非现任董事。这些关系之所以重要,是因为这些组织在Signapse自身质量流程中所处的位置。其《翻译质量保证政策》将与RAD和Action Deafness的协商列为外部审查环节。阅读该清单的买家理应合理地认为,这些组织独立于其所审查的公司。就RAD而言,只有在这种关联被披露和管理的前提下,这一假设才能成立。Signapse表示,其公司章程第30条自2024年起即对董事利益冲突作出规定,要求进行声明,并允许董事会设定条件或将某董事排除在讨论和表决之外,且Wheatley先生在RAD的职务已依据该条款予以声明。公司章程中的利益冲突条款并非利益冲突登记册。Signapse于9月17日确认,其并未维护此类登记册,且这两种关系均未在其《质量保证政策》中披露。 聋人顾问委员会的上报机制。Signapse的《使用政策》赋予其聋人顾问委员会对“社区影响以及文化/语言准确性”的监督权。一个咨询机构的力量,取决于其通往决策者的渠道有多牢靠。Wheatley先生同时也是聋人顾问委员会的成员,而他所加入的投资委员会拥有否决权。9月17日,Signapse承认这一渠道“依赖于一人同时兼任两个席位”,且背后并无成文规则支撑。9月24日,该公司补充说,已有多次事项从顾问委员会上报至董事会,并有董事会会议记录为证。这两种说法可以同时成立:上报确实发生过,但目前尚无任何书面规则保证其必然发生。倘若Wheatley先生离开其中任一席位,便没有任何书面文件能将顾问委员会的关切上传。 95%这一数据。当被问及其材料中95%这一数据的依据时,Signapse无法找到来源,遂将其撤回,并表示将以由聋人用户反馈会议和评估支持的数据取而代之。Signapse于9月24日确认这一说法准确无误。撤回该数据是正确的做法,该公司也毫无异议地这样做了。但其他有关性能的表述依然存在。截至9月26日查阅时,ASL页面仍称两名ASL数字手语员提供“行业领先水平的理解能力”的翻译,这是一项比较性宣称,却没有说明来源或方法。《质量保证政策》中列出的60%、80%和98%这些准确率数据,被表述为路线图目标,而非实测结果。在公布来源、方法和分母之前,买家应将该公司提供的任何性能数据视为未经核实。 Jay与Max。Jay和Max是Signapse的ASL数字手语员,属于合成形象:屏幕上呈现的面孔并非其手语数据来源者本人的面孔,因此他们不适用于《奖励与报酬政策》。这种设计自有其逻辑。《使用政策》规定,AI生成的输出内容“不得暗示任何个人手语使用者的认可、身份或作者身份”,而合成面孔正好使任何具体个人的身份不出现在屏幕上。但这并未消除手语背后的真实人物,只是将有关他们同意与报酬的问题移出了公众视野。Signapse表示,曾有多名聋人手语使用者(包括认证聋人口译员)为Jay和Max做出贡献,并依据私下安排获得股权和报酬,但此处未指名道姓。 截至2026年9月26日查阅的公开页面。Signapse于9月24日报告称其ASL页面的更新已经完成。然而NCG于9月24日及26日两次查阅的ASL页面(https://www.signapse.ai/asl)将Jay和Max介绍为“AI ASL数字手语员”,称其采用“照片级真实感”,并归功于“聋人主导的开发”,但并未说明他们是合成形象,也未说明其背后人员如何获得报酬。关于合成的唯一说明是网站全站页脚中的免责声明:“并非所有视频均为合成视频”,但并未说明哪些视频是合成的。此前在隐私政策(https://www.signapse.ai/privacy-policy)中发现的未填写的模板占位符已不再出现。当前政策为2.0版本,现将照片、视频和录音列为身份数据,残疾情况列为健康数据,但仍未提及模型训练、数字肖像或生物特征数据。 承诺与日期 Signapse已承诺作出七项改变。综合来看,这些改变将弥合上文所述的大部分缺口:一份利益冲突登记册、聋人顾问委员会的书面上报渠道、供反馈聋人使用的书面协议、关于Jay和Max的公开披露、一份美国合规性对照文件,以及一份涉及手语视频和训练数据的隐私政策。这份清单在该公司的两次回复之间发生了变化:两项日期提前,两项变得不那么具体,一项被报告为已完成,还有一项在最终说法中悄然消失、未作任何说明。9月24日,该公司将所有这些描述为“可能发生变化的内部计划”。这一保留说法是公允的,但这也正是本记录存在的原因。写在信函中的计划对任何人都不具约束力。下表列出了每项承诺及其两次陈述的日期,以便买家了解承诺的内容、时间以及其变化情况。 三项承诺定于10月到期,而这些恰恰与治理最直接相关。利益冲突登记册是唯一一项在两封信函中日期保持不变的事项。它将使第30条从一项私下规则变为买家可以查阅的记录,并将Wheatley先生兼任的两个职位以及日后任何类似的重叠情形正式记录在案。顾问委员会章程的日期提前了两个月,它将以一项经得起成员变动考验的书面权利,取代目前依赖一人兼任两个席位的上报渠道。参与者协议的日期也提前了,但内容却在此过程中缩水。9月17日,Signapse提议对条款本身作出修改,取消转让条款和放弃条款;而到最终信函时,条款本身维持不变,该承诺变成了为反馈会议参与者另订一份协议。相较于此前逐一通过电邮达成的安排,这仍是实质性的改进,但反馈条款依然保留在已发布的条款之中。当这些文件出台时,买家应核查三点:登记册是否列明每一段关系及其管理方式;章程是否以明确措辞赋予主席上报权利,并已获投资委员会批准;参与者协议是否授予的是许可而非所有权,是否保留贡献者的精神权利,并说明其获得的报酬。 ASL页面的情况有所不同。在短短一周内,Signapse将其目标从2026年12月或2027年初调整为“已完成”,倘若该页面确实呈现出相应内容,这将是清单中进展最快的一项。但截至9月24日和26日的查阅结果,情况并非如此。这是该公司说法与公开记录唯一相互矛盾的一项,NCG将其记录为尚未完成,直至两者相符为止。 两项最重要的事项则朝相反方向发展,各自从一个明确的季度推迟为一个未指明的年份。二者的重要性远超其在表格末尾位置所暗示的程度。学区、大学或州级机构在签约前,需要了解该ASL产品如何处理第508条、FERPA下的学生记录、COPPA下的儿童数据,以及各州有关生物特征和肖像数据的法律,因此美国买家应将合规性对照文件作为合同交付物写入合同,而非坐等其完成。隐私政策的重写将为治理框架补上目前所欠缺的数据层面内容。该政策2.0版本已略有进展,取消了模板占位符,并将视频列为身份数据,但仍未提及训练、肖像或生物特征数据。 还有一项承诺不知去向。在《质量保证政策》中标注与RAD和Action Deafness关系这一项,9月17日尚无日期,到9月24日则干脆未再提及。这是清单中成本最低的一项整改——只需在Signapse已经发布的政策中添加一条披露——同时也是最直接回应上文所提独立性问题的一项。其缺失或许只是疏漏。NCG将其视为尚未完成事项。 NCG只有在文件本身被公开或提供时,才会将各项标记为已完成。10月将是第一个检验节点。…
Read NowNovara Consulting Group Insights Heather M. Grizzle Microsoft AI published its Code of Conduct for MAI models on 14 September 2026 and opened a six-week public consultation on the text. The document sets out the intended behaviors, values, and guardrails…
Read NowFor years, the dominant story in artificial intelligence was speed. Build the more capable model. Ship the agent. Beat the competitor. Raise the capital. Expand the benchmark. Get the product into the market. Governance could catch up later. Later appears…
Read Now*手语转文字系统中的自信型误译,以及无法察觉它的基准测试* 2026年9月9日,中国科技媒体量子位报道了vivo AI Lab提出的一种名为CAPO-SLT的方法,出自一篇题为《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》的论文,发布在同行评审期间论文所在的平台OpenReview上。它所指出的问题正是任何购买这项技术的人都应担忧的问题。一个翻译系统可能生成一句流畅、语法正确、看起来完全可信的话,却与手语者实际所打的内容毫无关联,而由于这句话读起来很顺畅,其中没有任何迹象会暴露这个错误。正如报道所述,一个局部看似合理却缺乏视觉依据支持的词,可能使整句翻译偏离方向,且错误会在整句话中不断累积。该方法根据前一策略的置信程度,逐词调整强化学习被允许更新模型的范围:置信度高时收紧边界,接近0.2;置信度低时放宽边界,最高到0.3,并对带有负优势值的词元施加额外上限。其目的是阻止模型固守自信的猜测,同时为不确定的猜测留出空间,使其能够被拉回到视觉证据所支持的方向。 报道中的结果比标题所暗示的要窄得多,而这一差异很重要。在中文基准测试CSL-Daily上,所报告的提升是相对于另外两个同样基于姿态输入的命名系统而言的:相较Geo-Sign约提升1.26个BLEU-4,相较Uni-Sign约提升3.07个BLEU-4,其说法是在仅使用姿态输入的系统中取得最佳成绩,而非在整个领域中最佳。在美国手语基准测试How2Sign上,报告的数字为41.4 BLEU-1、15.2 BLEU-4和34.9 ROUGE-L,相较Uni-Sign的提升约为一个点或更少。本分析未能读到论文原文,因为托管论文的仓库需要浏览器验证步骤,因此以下内容审视的是该研究所指出的问题、其所处理的翻译方向,以及所提供证据的类型,而非对该系统本身作出评估。这些内容本身就值得审视,因为这个问题是真实存在的,其所涉及的翻译方向恰恰是各机构处理最不谨慎的方向,而所提供的证据类型也无法证明它被要求证明的东西。 翻译方向为何 围绕手语人工智能的大多数公开争论,关注的是面向聋人的输出:发车时刻表上的手语虚拟形象、网站上的手语视频、教室里的机器人。而手语转文字的方向恰恰相反。输入是一位聋人在打手语,输出则是供其他所有人阅读的文字,这改变了“错误”的含义。当虚拟形象打得不好时,聋人得到的是一份糟糕的翻译,而且通常能察觉到有什么地方不对。而当手语转文字系统编造出一句流畅的话时,这位聋人所说的话就被替换成了他们从未说过的话,而这些话会被送到临床医生、个案工作者、调查人员或法庭记录员手中,这些人根本无从得知发生了什么。 这种不对称性正是治理层面的问题所在。房间里唯一能察觉这一错误的人,是其原意被替换的那个人,而这个人往往正是从未看到输出结果的那个人。以这种方式产生的文字并不会凭空消失:它会被打进接诊记录、陈述书、绩效评估或案卷之中。一旦进入这些文件,它便获得了正式记录的权威性,而不再只是机器翻译的状态,聋人必须去反驳一份声称在引用自己原话的文件。这个方向上的流畅型错误,并非一次访问便利措施的失败,而是一种归属认定,而各机构几乎没有任何机制来撤销这种认定。 该指标看不到失败 这一方法所报告的每一个数字,乃至几乎所有同类系统所报告的数字,都是BLEU或ROUGE。这两者的工作原理都是将机器输出与参考翻译进行比较,测量词序列的重合度。它们最初是为口语机器翻译设计的,衡量的是与参考文本的相似度,而这与忠实反映手语者所表达的内容并不是一回事。一句编造出来的话,只要恰好与参考文本共享常见措辞,就能得高分。而一句措辞不同但翻译正确的话,反而可能得低分。这一方法所要修复的失败模式——流畅却缺乏视觉证据支持的输出——恰恰正是这些指标最难以察觉的失败类型,因为流畅性正是这些指标所奖励的东西。 这并非来自该领域之外的批评。萨里大学视觉、语音与信号处理中心本月发布的一篇论文,对六个翻译系统进行了评估,得出结论称“BLEU-4分数的提升本身并不能证明手语理解能力的提升”,并指出这种低资源多模态设置“使模型得以利用虚假相关性和口语先验,而非学习更强的手语表征”。他们提出的替代协议检验的是段落内容是否得以保留,该协议重新排列了各系统的表现排名,揭示出一个BLEU-4根本无法察觉的差距。结合这一发现来看,BLEU-4分数的提升只能证明输出与参考文本更为相似,尚不能证明系统理解了手语内容,更不能证明自信型编造已经减少。 这里所报告的提升幅度本身也很重要。相较命名基准系统约一到三个BLEU-4点的提升,是普通的渐进式进步,而它们却被当作系统编造程度降低的证据来提出。结合萨里大学的发现来看,这正是整个论证中最薄弱的一环:在一个连该领域自身都承认无法反映手语理解能力的指标上,提升几个点,不足以证明自信型编造已经减少。这一说法或许仍然成立,但要证明它,需要用不同的检验方式,而这种证明理应能在论文中找到——只是这篇论文尚处于审稿阶段,并未正式发表。 置信度是训练信号,而非披露信息 从表面上看,这一方法最有意思的地方在于,它把模型自身的不确定性当作值得据以采取行动的信息。这种直觉是对的,它指向了采购方本该要求的东西,只是这一方法所提供的形式并不完全对路。用于训练内部的置信度值,改变的是模型的学习方式,它并不会传达给阅读输出结果的人,也不会改变模型不确定时输出结果的样子。系统依然会生成一句流畅的话,因为生成流畅的话正是它的本职工作。文本中没有任何地方表明其中三个词是猜测出来的。 有两件事可以改变这一点,而且都不难做到。第一是“弃权”机制:系统应当能够拒绝作答。一个能够表明“这段内容未能被清晰捕捉”并标记出空缺的手语转文字系统,要比一个总是给出完整句子的系统安全得多,因为可见的空缺会促使人工去补全,而流畅的编造却不会。第二是“暴露”机制:系统所具备的置信度,应当在使用环节可见,低置信度的片段应当在送达读者的文本中被标记出来。厂商所声称的95%准确率描述的只是一个平均值,而平均值无法告诉采购方剩余那5%究竟是什么性质。5%的噪声只是个麻烦;而5%的自信型编造,不可预测地散布在一份病史或证词之中,则完全是另一种产品——而大多数厂商所公布的那一个数字,根本无法区分这两者。 姿态输入能承载什么、不能承载什么 据报道,该系统基于姿态数据工作,也就是被追踪的身体关键点,而非原始视频。这确实带来了真实的隐私优势,因为关键点数据的可识别性远低于手语者面部的实拍画面,而在这样一个数据即是人体本身的领域里,这一点至关重要。但它也引出了一个若不读到论文原文便无法回答的问题:究竟是哪些关键点。手语的语法承载于面部之上。摇头可能会否定其所伴随的整句话,眉毛的位置可能标示出陈述句与疑问句的区别,口型则用来区分那些手部动作相同的手语词。如果关键点集合对面部的采样过于稀疏,系统可能在结构上根本无法察觉那些能够反转句意的特征,由此产生的失败正是流畅型的:手语者本是否定的意思,却输出一句干净利落的陈述句;或者手语者本是在提问,输出的却是一句陈述句。而在临床或法律场景中,一句话与其否定形式之间的差别,就是全部内容的差别。 基准测试不等于实际部署 CSL-Daily是一个在实验室环境中录制的中国手语语料库,内容涉及日常话题。How2Sign是一套大型的美国手语教学视频集合。二者都是严肃的研究资源,但都不代表机构实际使用手语转文字技术时的真实情况:一个处于疼痛之中的人,从病床上以摄像机原本未曾设计适应的角度打手语,使用地区性变体,一只手因插着输液导管而无法活动,时而被打断,情绪激动,或在不同语域之间切换。正因如此,报告中的How2Sign数字——15.2 BLEU-4——值得牢记。在这两个基准测试中相对更为开放领域的那一个上,在有利条件下,该领域现有水平所产生的输出,与人工参考翻译的重合度依然有限。这是一个合理的研究结果。但它不应成为任何依赖于记录聋人患者所说内容的依据。 采购方应当要求什么 由此可得出六项要求,它们均针对这一翻译方向而specific(特定)。第一是带有可见空缺的弃权机制,使不确定性以空缺的形式呈现,而非以散文的形式呈现。第二是在交付文本中标记置信度,让读者而非仅仅是模型能够获取这一信息。第三是在记录任何内容之前先向手语者进行回译,使聋人能够用自己的语言看到系统即将以他们的名义说出的内容,并有机会予以阻止。第四是记录中的来源标注:凡是源自机器翻译的文本,无论存储在何处,都应标明其来源,并保留原始出处,以便日后如有争议,争议的焦点是机器的输出,而不是当事人的可信度。 第五是能够触及记录本身、而非止步于厂商客服台的更正渠道,因为案卷中未被更正的一句话,其存续时间会远远长于任何一张工单。第六是与所声称成效相匹配的证据:采用检验内容是否得以保留的协议来衡量语义忠实度、针对否定句、疑问句和角色转换进行对抗性测试、按手语变体和拍摄条件进行分类统计,并由聋人手语者进行理解度核查,而非仅凭参考文本重合度来推断。NCG的立场是:所需证据的严格程度应随应用场景风险的提高而提高,而一个其错误会进入正式记录并被归于某人名下的系统,理应处于这一标准的顶端,而非中间位置。 这一说法是如何传入英语世界的 这里还有第二个故事,而它同样属于关于证据的这篇文章的一部分。量子位的报道来源可靠:它指名了该方法,描述了其运作方式,报告了相较于命名基准系统的提升幅度,并附上了论文链接。而当这一信息传到英语读者手中时,已经经过了一个署名为“AI编辑部”的网站,该网站自称是生成式引擎优化门户,意即其内容是为了被人工智能搜索工具检索和复述而撰写的,并且还会给自己的文章打质量分。那个版本删去了指向论文的链接,并将相对于特定基准系统所测得的提升,转换成了扁平化的绝对分数。这其中没有任何欺诈成分,它不过是一份摘要的摘要,经过优化以便被机器抓取,而它悄悄去掉的,正是通往证据本身的路径。 这一点值得特别指出,因为如今大多数采购官员正是通过这样的路径接触到关于这项技术的说法。一项厂商说法,首先作为投稿论文进入学术文献,继而被行业媒体准确报道,再被聚合平台改写以便于检索,然后被某个人工智能助手检索到,最终出现在一份简报中,数字被硬化为确凿的结论,引用来源却已消失不见。每一步单独来看都说得过去。而最终结果是一个没有分母、没有基准、也没有背后文献支撑的数字,却比原作者所声称的更为斩钉截铁地呈现出来。能够保护采购方的那种审慎态度,正是本文对这项技术所要求的同一种态度:把说法追溯回它的出处,并坦率说明哪些内容自己未能核实。 本分析的局限性 本文对CAPO-SLT的介绍,依据的是对这项工作进行报道的中文行业媒体报道,该报道指名了论文并附有链接。论文本身托管在一个需要浏览器验证步骤的平台上,本分析未能读到原文,因此文中所引用的数字均为转述而非核对原始文献所得,以上内容均不应被解读为对该系统或对vivo…
Read Now2026年9月2日发布于arXiv并被EMNLP主会议接收的一篇论文描述了DiscoSign,这是一个将英文文本翻译为美国手语(ASL)字符注释的框架,同时保持对已表达内容的追踪。其作者是来自Apple和Gallaudet University的研究人员,多家聚合媒体报道称该论文于9月11日出现在Apple的机器学习研究网站上,这也是该领域之外大多数读者接触到它的途径。其技术主张是狭窄且表述清晰的。大多数文本到手语系统一次只翻译一个句子,句子之间没有记忆,因此在一处被安放的指代对象可能在下一句中被悄然重新指派,同一概念可能在连续三句话中被三种不同的手势呈现,而组织手语话语的修辞结构也无法被选择,因为系统看不到话语整体。DiscoSign添加了跨句子持续存在的显式登记表,将其作为对模型的约束加以执行,然后据此验证并修正输出。 这是针对一个真实缺陷的真实进步,论文对其未能做到的事情也坦诚相待。而治理层面的重要性则更进一步。当一个系统在整篇文档中携带状态时,可能出错的单位就不再是句子。错误不再是独立事件,而开始成为整段文字的属性,而该领域已建立的评估方法——对句子逐一打分再取平均——无法看到这一点。风险不在于这项研究夸大了自身,而在于“具备话语意识”这个说法会先于任何人就如何检验话语是否真正被妥善处理达成一致,就已出现在采购文件中。 论文声称了什么,以及它对自身的说明 DiscoSign处理三种现象。第一种是空间共指:在ASL中,实体被指派到手语空间中的位置,随后通过指向该位置来回指,因此系统必须记住Alice被安放在左侧、Bob被安放在右侧。第二种是问答从句(Question-Answer Clauses),即打手语者提出一个修辞性问题并立即作答的话题—述题结构,这种结构在某些话语位置是恰当的,在另一些位置则显得生硬。第三种是概念—字符注释一致性,意味着一篇文档中出现五次的某个概念每次都应以相同的手势呈现,而不是在近义手势之间来回切换。每一种现象都由一个模块处理,该模块维护一个登记表,将其作为硬性约束提交给语言模型,然后检查返回的输出并就地修正违反之处。 论文报告称,与句子级基线相比,这大幅提升了空间一致性和实体追踪能力,同时保持单句质量不变,并且论文引入了自有的指标,因为正如其所言,标准机器翻译指标“无法捕捉话语层面的质量”。其局限性部分异常直率。该框架“通过字符注释处理手动手势的生成,但未纳入面部表情和韵律等非手动标记(NMMs),而这些标记在手语中承载着关键的语法和情感信息。”其三个数据集之一“缺乏真实的ASL标注”,因此部分话语层面的评估依赖于自动指标和回译。判定问答从句何时恰当的规则“无法体现”这一有时纯属风格问题的结构所具有的可选性。作者还指出,他们“与手语社群成员进行了合作”,并有Gallaudet的共同作者参与,这在该领域的文献中并非常态,应当予以明确指出。 一致性不等于准确性 使DiscoSign得以运作的机制,恰恰也是使其成为治理问题的原因,而这一点无法仅凭阅读摘要得出。一个登记表强制要求早期做出的决定被贯彻始终。如果该决定是正确的,整段文字便是连贯一致的。如果该决定是错误的,整段文字便以同样的方式全部错误。第二句中被指派到错误位置的指代对象,不会只产生一个坏句子;它会产生这样一份文档:此后每一次引用都自信地指向错误的人。被映射到不精确手势的某个概念,并非一次孤立的失误;而是这个手势被反复使用,系统的一致性机制还在主动阻止本可能因变化而引入的纠正。论文自身对该流程的描述称,“在字符注释阶段引入的话语层面错误会贯穿整个流程传播。” 句子级系统的失败是嘈杂的,而嘈杂的失败有一个未被充分重视的特点:读者会察觉到它。不一致性作为一种缺陷是可辨识的。而一个始终如一地犯错的系统,看起来就像是一个言之有意的系统。对于接收输出而非将其与原文核对的聋人读者而言,一个稳定但错误的指代对象根本不像是一个错误;它只是文档所写的内容而已。这颠覆了通常的假设,即更好的内部连贯性更安全。连贯性在降低错误可见度的同时,提高了犯错的代价,而任何逐句评分的平均值都无法显示这一点。 新指标衡量的是什么,以及是谁验证了它们 论文在这一点上颇为谨慎,这份谨慎值得细读,因为它决定了下游可以负责任地提出何种主张的上限。新指标衡量的是空间索引一致性、概念—字符注释映射的稳定性,以及问答从句使用的恰当性。三者中有两者衡量的是系统是否始终如一地做同一件事,这是就输出本身而言的属性,并非衡量聋人读者是否理解了这段文字。为验证这些指标,两名ASL流利的评审员对三十二个故事、共一百五十二个句子按五分制打分。空间一致性与他们的判断呈中等程度相关。概念—字符注释一致性也呈相关。问答从句恰当性指标未达到统计显著性,论文将此归因于评审员之间在何为此类从句这一问题上存在分歧,两者之间的加权一致性被描述为中等程度。 对于验证一项新指标的研究贡献而言,两名专家评审员是合理的设计,而对负面结果的坦诚也值得肯定。但作为机构部署的依据,这远远不够,论文本身也并未声称如此。若这项工作要走向采购环节,有三点区别至关重要。第一,将自动指标与专家对同一属性的评分相关联,并不等同于衡量聋人读者是否理解了该文档,而这一点目前尚无人在话语层面做到过。第二,“ASL流利”并非“聋人”的同义词,论文也未报告评审员的聋人身份、认证或背景。第三,当合格的评审员对某一语法结构是否存在都意见不一时,一项自动化评分断言其使用是恰当的,无论其给出何种数值,都尚不能算作一件保证性文件。 字符注释仍然不是语言 将此报道为手语人工智能已超越逐句翻译的说法,超出了实际所建成的内容。DiscoSign生成的是字符注释,一种代替手动手势的书面标签序列,而作者也直接说明未纳入非手动标记。在ASL中,论文试图保留的大量话语结构恰恰存在于那些渠道之中。话题标记、构成该框架所建模结构本身的问句与答句之间的边界、标示所表达视角归属者的角色转换、将某一指代与空间中某一位置相联系的目光注视:这些都由面部、头部和身体承载。字符串可以记录某个指代对象是索引j;它无法记录使该指代得以落实的目光注视。 作者意识到了这一点,并就此说了一些有用的话,即他们的登记表所保存的状态,已接近下游视觉系统生成非手动标记所需的信息,从该登记表推导出这些标注是自然而然的下一步。这是对未完成工作的一个清醒描述。它与一个能够生成连贯手语话语的系统并不相同,而这两者之间的距离,正是采购官员在阅读新闻摘要时会被误导之处。一位被告知供应商的流程“具备话语意识”的买家,理应有权询问这指的是哪个阶段,以及字符注释之后的下游环节是否保留了这一点。 那个未被点名的数据集 论文列出了三个数据来源:ASL STEM Wiki、来自Project Gutenberg的《伊索寓言》,以及,用其自身的措辞,“一个授权数据集”。前两者是明确且可核实的。第三个未被点名。这是常规做法,很可能反映的只是商业授权而非任何不妥之处,但它值得作为一个悬而未决的问题被记录下来,而非略过不提,因为在手语工作中,语料库的来源关乎人。手语数据来自打手语者的记录,他们的面部和身体本身就是数据。这些打手语者是否为机器翻译研究同意授权、是否获得了补偿、授权允许下游做什么,在来源未被点名的情况下都无法解答。一个日益取决于其语料库质量和来源的领域,终将被监管机构和聋人组织问及这些问题,而点明来源是为此做好准备最廉价的方式。 当系统具备记忆时,评估会发生哪些变化 如果具备话语意识的系统成为常态——发展方向也表明会如此——那么任何评估这类系统的人都需要能够在系统现今运作层面上运作的工具。从这篇论文所展示的内容中,可以得出六项要求。第一是长度下的持久性:在三句话范围内测得的一致性,无法说明系统能否在一整页文字中维持十几个指代对象,因此测试必须明确文档长度和指代密度,而非报告一个平均值。第二是传播性:评估应报告单个早期错误影响的范围,以受影响的下游句子数量来衡量,而不是将其稀释为整篇文档的一个分数。第三是最差情形应与均值并列呈现,因为一个机构所承受的风险,取决于失败的那段文字,而非平均水平的文字。 第四是恢复能力:应测试一个保持状态的系统,能否在后续文本与早先推断相矛盾时修正某项指派,以及当文档合理地重新指派某个指代对象时会发生什么。第五是在正确层面进行人工校正,因为逐句核对的审阅者会通过一段其错误属于整体属性的文字,这意味着为句子级输出而写的审阅程序无法照搬使用。第六是聋人读者的理解程度,应针对整篇文档、以人工手语作为对照来衡量,这仍是唯一能证明所测量的任何内部一致性真正传达到其目标受众的证据。NCG的立场——这篇论文并未与之相悖——是内部指标是保证工作的一项输入,但绝不能替代经过验证的输出,而所需证据的多寡随输出所用场景的利害关系而上升。 本分析的局限性 本文的解读基于所发布的arXiv版本论文,以及关于其出现在Apple研究网站上的公开报道,后者未经独立核实。DiscoSign是研究,不是产品:此处所述内容并不涉及任何已部署的系统,没有供应商就此提出任何主张,NCG也未对其应用任何工具。以上批评并非针对作者本人,他们自己已陈述了大部分这些局限性,并通过发布使话语层面失败首次可被衡量的指标,为该领域做出了贡献。这里的论点在于接下来会发生什么——当一项真正的研究进展,被那些未曾读过局限性部分的人压缩成一句能力宣称之时。 这篇论文的有益之处在于,它使一个隐藏的问题变得可见。句子级系统一直以来在话语层面都存在失败;只是此前没有工具能够察觉这一点。如今这样的工具才刚刚起步,而它伴随而来的一项发现,更应被当作警示而非仅仅是结果来看待。让一个系统保持一致,并不能使其正确。它只会使其要么从头到尾正确,要么从头到尾错误,并且在任何人读到输出的只言片语之前,就已经决定了会是哪一种。 资料来源 1. Vasileios Baltatzis, Mert Inan, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah…
Read Now按分钟计费的合成手语,以及当文件离开时留在原地的治理机制 2026年9月9日,Signapse推出了SignStream Chat,这是一款聊天式工具,用户输入一句英语句子,即可获得一段由AI生成的视频,视频中的数字手语者以英国手语或美国手语将其呈现出来,德国手语则被列为即将推出。每位用户每周可获得六十秒的免费翻译,并可通过按需付费的方式购买更多额度。与此同时,Signapse还公布了SignStream API的按分钟计费方案:每月使用不超过200分钟为每分钟2.00美元,不超过1000分钟为每分钟1.75美元,不超过4000分钟为每分钟1.50美元,输出平均耗时十五秒。三月份,该公司在宣布将于本月与流媒体集成商G&L合作推出德语手语者时——该产品本周正在IBC作为创新奖决赛入围项目展出——公司联合创始人Sally Chalk表示,“AI手语已不再是实验性的;我们可以把它交到人们手中。”SignStream Chat正是这句话的字面实现。 这次发布标志着市场格局的变化,值得精确说明究竟发生了什么变化。迄今为止,合成手语主要是通过机构选择并付费的安排触达聋人:铁路运营商的发车信息屏、广播机构的直播流、公共机构的网站。这些安排背后有一个可以提出疑问的买家,一份可以附加条件的合同,以及一个能够控制输出内容出现位置的提供者。SignStream Chat销售的是不同的东西。它按分钟向任何人出售一个文件,而这个文件可以流向任何地方。本文认为,Signapse所公布的治理机制——在该行业中已属较为完善——是为第一种安排而构建的,并不能延伸至第二种安排,而且这一差距是结构性的,并非某家公司的疏漏。 公司自己所宣布的推出内容 Signapse对新产品的局限性异常坦诚,这份坦诚在其他一切评价之前就应当得到肯定。SignStream Chat的发布公告指出,“由于SignStream Chat实时生成翻译,这些翻译在您收到之前并未经过我们翻译团队的审核”,并建议该工具“用于非正式和创意性用途,而非正式或高风险内容”。API页面的措辞更加直白。当被问及输出内容是否经过人工核查时,答案是:“没有,而这一点很重要。API完全由AI生成,没有人工语法核查或质量保证。”它将该服务描述为“不适用于正式、法律或官方用途”,“最适合非正式消息传递或测试新的无障碍理念”,并将正式工作引导至另一款经过审核的独立产品。在这一领域,很少有供应商如此坦率地说明自身产品的边界。 同一份公告描述了输出内容的去向。视频“可以以多种格式下载,随时可在社交媒体平台上分享、嵌入内容中,或用于任何需要手语无障碍服务的场合。”定价页面在API层级的功能列表中写道,“水印:无。”Signapse的技术说明文档指出,其数字手语者完全来自“聋人母语手语使用者”,在“明确书面同意”下使用,并遵循“商业场合形象使用报酬方案”,系统生成的视频“与真人手语者无法区分”。这些陈述单独来看都合情合理。但合在一起阅读,它们描述的是这样一款产品:其输出未经审核、逼真、没有任何可见水印、以真实聋人为原型,并且被设计成可以带离其制作环境。 为可控部署而设计的治理机制 Signapse发布了一份由其首席执行官签署的AI治理框架,其中大部分内容都相当审慎。其使用政策按行业划分,规定何时适合采用人工翻译或AI翻译,声明安全保障事项“始终由人工负责”,要求在现场互动的法律和医疗沟通中配备合格译员,并禁止AI在未经监管批准的情况下用于评估、评分或考试内容。其内部工作流程区分了经审核的输出与即时输出,规定“AI质量控制在交付过程中进行审核,即时AI则在交付后进行审核。”其标签承诺写道:“在我们能够掌控的范围内,我们将为用户标注AI生成内容(例如屏幕图标)。”其行为准则声明,“手语使用者应对其数字形象的使用方式保有自主权”,以及“AI生成的手语输出不得暗示获得任何个别手语者的认可、身份认同或署名权。” 这些控制措施无一例外都假设了一个新产品所不具备的前提:即Signapse或受合同约束的机构客户能够控制输出内容出现的位置。当客户的部署方式能够与某个行业相匹配时,行业矩阵可以约束使用行为;但它无法约束下载后的文件。当提供者能够撤下或替换发车信息屏上的片段时,交付后审核是一项有意义的保障措施;但它无法追回已发布到社交媒体账户或嵌入他人网站的副本。标签承诺本身就以“在我们能够掌控的范围内”为限定条件,而下载的文件就其定义而言正是控制权已经易手的情形。禁止暗示手语者认可的规定是一条关于输出内容的规则,但一旦输出内容成为独立存在的视频,唯一能够遵守这条规则的一方就是转发它的人。这一切并不意味着该框架并非出于真心。它意味着这是一个为部署场景而设的框架,如今却被套用在一款销售文件的产品上。 一个没有标签的逼真手语者 这一后果对那些形象被系统使用的人来说最为严峻。一位在社交媒体上看到下载后的SignStream片段的观众,所看到的正是该公司自己所描述的“与真人手语者无法区分”的内容,而根据定价页面提供的信息,也没有可见水印来告知他们事实并非如此。这些文件是否带有屏幕AI图标或嵌入元数据,在本分析所查阅的产品页面中并未说明,也未经测试核实。如果两者皆无,观众就无从得知那个看似在打手语的人从未说过那些话,而这些话是由一位可能根本不懂这门语言的匿名用户所选定的。授权使用其形象的聋人手语者是在书面同意和版税安排下这样做的,这已经比该行业大多数做法更为规范。但这份同意涵盖了什么范围,以及它是否考虑到了一款自助式工具——通过它,任何人都可以让他们“说出”任意句子并公开发布结果——Signapse在关于SignStream Chat的任何公开材料中都没有给出答案。该公告也没有说明公司公布的内容审核政策是否适用于用户输入的文字。 这里还存在一个监管层面的问题,不过应当谨慎表述。欧盟《人工智能法案》第50条要求生成合成视频的AI系统提供者以机器可读的格式标注其输出,使其能够被识别为人工生成,并要求部署者在视频与真实人物相似、可能被误认为真实内容时明确披露这一点。部署者披露义务自2026年8月2日起生效;提供者标注义务目前适用于该日期或之后投放欧盟市场的系统,已在市场上销售的系统则有过渡期至2026年12月2日。这些条款是否以及如何适用于一家英国提供者的自助式产品,下载文件中是否存在机器可读标记,以及以真实人物为原型的数字手语者是否落入深度伪造条款的适用范围,这些都是本分析未予解答的法律问题,本文所述亦不构成法律建议。然而,任何欧洲市场的买家——包括即将推向市场的德国手语(DGS)手语者所面向的德国广播机构和相关机构——都有权提出这些问题。 反馈送到了错误的人手中 SignStream Chat配备了一套反馈系统,而其设计从另一个角度揭示了同样的结构性差距。用户可以为每段翻译打出五星评分,提交书面反馈,或录制视频反馈,公告将此描述为用户“帮助塑造工具成长”的一种方式。问题在于“用户”是谁。一款将输入的英语转化为手语的工具,对不会手语的人最有用,而不会手语的人无法判断手语表达是否正确。最有能力判断的人,是熟练的聋人手语使用者,而他们通常不是坐在键盘前输入文字的人。他们是受众,而他们是在下游、以下载文件的形式接触到这些输出内容的,既没有评分按钮,也没有反馈给提供者的渠道。从最没有能力评估质量的一方收集质量信号,而最有能力评估质量的一方却无从反馈,这并不能替代审核,该公司自己的框架也并未如此声称。这实际上意味着,对于这款产品而言,错误最有可能被那些最缺乏举报手段的人所发现。 早于产品本身的条款 Signapse网站上公布的服务条款最后更新于2023年10月1日,比SignStream Chat推出早了近三年,且完全没有提及该产品。这些条款授予用户下载内容的许可,“仅限用于您个人的、非商业性的用途或内部业务目的”,将“内容”定义为包括“服务中的”视频,并禁止未经公司书面许可将内容用于任何商业目的的再发布或分发。相比之下,产品发布公告却邀请用户将下载的视频分享到社交媒体上并嵌入内容中。目前从公开记录中尚不清楚:生成的视频是否属于条款所定义的“内容”范畴,一家小企业发布带手语的宣传是否构成商业使用,输出内容的权利归属于谁,以及当一段未经审核的翻译出错、有人因此受到影响时责任由谁承担。Signapse很可能在注册时提供了专门针对该产品的条款,解答了这些问题;若果真如此,这些条款并未公开,买家在购买前也无法阅读。这里的关键并不在于条款本身存在缺陷,而在于买家通常会查阅以了解权利与责任的文件,是为另一款不同的产品而撰写的。 从试点到按分钟计费 这次发布的更广泛意义属于解读范畴而非既定事实,这一点应当明确标注。手语AI在短时间内经历了从研究到演示、从演示到机构试点、再从试点到企业合同的演变。按分钟计费的自助式定价是又一步,朝着将合成手语变成一种商品化输入的方向发展——个人和小型组织无需采购部门介于他们与产品之间,便可直接购买。这一转变对治理而言至关重要,因为该领域的大部分保障机制都是围绕机构采购这一环节设计的。采购问卷、合同条件、部署审查,以及NCG一直主张的那类证据标准,都假定存在一个会提出疑问的买家。而一个社区团体在制作手语活动通知、一家小零售商在宣传中加入手语、或一位教师在准备课堂通知时,可能根本不知道该产品的提供者自己就建议不要用于正式场合,而他们下载的文件中也不会有任何内容告知其受众这一点。 建议将SignStream Chat用于非正式和创意性用途,这是明智的。但这样的建议是给买家的忠告,而非输出内容本身的属性。它不会随文件一同传递,而它本应保护的那些人也永远看不到它。Signapse自己在三月的发布公告中表明的立场是,其技术“旨在补充而非取代合格的手语译员”,人类专业人员在“医疗、法律及高度敏感场合”中仍不可或缺。而在一个自助式市场中,这条界限能否守住,取决于成千上万个由非专业人士、针对无人审核的内容、面向无法辨别自己所看内容的观众所做出的个体决定。 要弥合这一差距,需要什么 以下内容都不预设SignStream Chat是有害的,而且其中数项措施在Signapse自身的框架中已有预见;问题在于这些措施是否能够延伸到文件本身。第一是能够在下载后依然留存的溯源标记:一种可见的标识,表明手语者是AI生成的,其位置设置应使得普通编辑操作无法将其移除,同时配以欧盟《人工智能法案》现已要求、且新兴内容凭证标准所支持的那种机器可读标记。第二是随输出内容一同传递的使用条件,也就是说,专为该产品撰写并在购买前公布的许可条款,要求AI生成的手语在被再次发布时须明确标识为AI生成,并清楚说明哪些用途被排除在外。第三是面向受众而非仅面向作者的举报渠道,使得遇到错误或被滥用片段的聋人观众无需账户即可联系到提供者。 第四点涉及手语者本人:一份公开声明,说明形象被使用的聋人所给予的同意是否延伸至开放式的自助生成场景,哪些输入内容会在源头被拒绝,以及手语者如何能够查看并对其形象的使用提出异议。第五点是衡量指标:公布未经审核的实时输出的错误率,并将其与经审核输出的错误率分开列出,使得这两类产品之间的差异成为一个数字,而非仅仅是一句警示语。这些问题是买家、监管机构或聋人组织可以合理地向任何销售可下载合成手语文件的提供者提出的。之所以首先向Signapse提出,只是因为Signapse率先迈出了这一步,也因为其已公布的框架本身就已包含了可供衡量答案的原则。 本分析的局限性 本分析完全基于Signapse截至2026年9月11日公开发布的网页、新闻稿、已公布的治理框架及服务条款,并参考了有关欧盟《人工智能法案》的公开资料来源。NCG未曾使用过SignStream Chat,未注册账户,也未检查过任何下载的输出内容;关于标签和标记的陈述,描述的是已公布页面所言与未言之处,而非文件实际包含的内容。Signapse是NCG在其Sign Language Access Trust(SLAT)指数下评估过的系统之一。本文中的任何内容均未报道或引用该项评估结果,而在该评估之后才推出的SignStream…
Read NowOn 9 September 2026, Agence France-Presse carried a report from a Nairobi secondary school for Deaf students on ZeroBionic, a Kenyan start-up whose 3D-printed robotic hands convert a teacher’s speech into signs in real time. Within two days the wire…
Read Now