Letters, briefs and reports can be shown with their own typography. Automatic keeps that only while none of your settings above ask otherwise.
Trends, analysis, and strategies for the modern rural economy.
2026年9月26日 · Heather M. Grizzle,Novara Consulting Group 本记录存在的原因 2026年8月,Novara Consulting Group公开询问Signapse,该公司如何界定手语AI的适当使用限度,特别是在涉及聋人儿童的教育场景中。首席执行官Sally Chalk认同这一前提,并进一步阐述。她将法院、警察局、医院、社会服务机构和儿童保护会议也纳入这份清单,并主张:随着风险上升、准备时间减少,一项服务应当涉及更多的人工监督、更少的AI,甚至完全不使用AI。这正是买家希望从供应商那里听到的立场。本记录要问的问题由此而生:支撑这家公司的文件是否能够支持这一立场。 从书面材料来看,Signapse的起点确实比市场上大多数同行更为扎实。其发布的《AI治理框架》包含一项《使用政策》,按行业逐一区分哪些工作必须由人工完成、哪些可以由AI完成。在涉及健康、自由、法律权利或保护性事项的决策场合,该政策要求必须有合格的口译员或笔译员参与,并声明在大多数此类情况下Signapse会推荐另一家公司。保护性事项则毫无例外地保留给人工处理。该框架列出了一个聋人顾问委员会和一名聋人影响官,并列出了该公司咨询的聋人组织,包括RAD、BDA和Action Deafness。很少有手语AI提供商能发布可与之相媲美的内容。然而,框架阐述的只是公司打算如何行事。买家还需要能使这种行为具有可执行性的文件工具。这些工具包括:与那些其手语和反馈塑造了产品的聋人签订的协议、约束那些同时领导合作组织的董事的规则,以及一份涉及手语视频、肖像和训练数据的隐私政策。买家还需要公司所引用的每一个性能数据都有公开的来源。这种既定意图与具有约束力的文件之间的落差,正是NCG提问所指向的地方。 NCG审查了Signapse的《AI治理框架》、服务条款、隐私政策和ASL产品页面,并向该公司提出了七个问题。在发布之前,NCG将其对答复的理解发送给Signapse,并邀请其予以更正。Chalk女士于2026年9月17日回复,并于2026年9月24日两次回复,第二次回复时她称这是Signapse对本次评估的最终意见。Signapse回答了全部七个问题。它以书面形式承认了若干缺口,撤回了一个无法溯源的准确率数据,并为其提出的整改措施附上了具体日期。它在9月24日的第一次回复中改变了一周前给出的三项答案中的内容。当NCG询问哪一版说法准确时,该公司当天就对全部三项作出了澄清。其最终答复基本回到了9月17日的说法。 这种变化本身并非对Signapse的不利评价,本记录也不将其作为不利评价呈现。它说明了为什么买家不应把采购决策建立在往来信函之上。信函是私密的,可以被修改,而且它们是写给一位顾问的,而非写给将要承担部署风险的机构的。购买手语AI用于聋人服务的公共机构,需要的是可以阅读、引用并据以问责供应商的文件。因此,本记录列出了目前存在的内容、该公司承诺做出何种改变及其时限,以及其答复在两封信函之间是如何变化的。每一项陈述都标注了作出的日期。仅在措辞的确切内容至关重要时才引用回复原文。凡NCG查阅了公开网页的地方,均注明了查阅日期。 Signapse是NCG按照同一方法正在审查的多家手语AI提供商之一,该方法载于SLAT Index框架文件(https://www.slatindex.org/framework/)。…
Read NowNovara Consulting Group Insights Heather M. Grizzle Microsoft AI published its Code of Conduct for MAI models on…
Read NowFor years, the dominant story in artificial intelligence was speed. Build the more capable model. Ship the agent.…
Read Now*手语转文字系统中的自信型误译,以及无法察觉它的基准测试* 2026年9月9日,中国科技媒体量子位报道了vivo AI Lab提出的一种名为CAPO-SLT的方法,出自一篇题为《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》的论文,发布在同行评审期间论文所在的平台OpenReview上。它所指出的问题正是任何购买这项技术的人都应担忧的问题。一个翻译系统可能生成一句流畅、语法正确、看起来完全可信的话,却与手语者实际所打的内容毫无关联,而由于这句话读起来很顺畅,其中没有任何迹象会暴露这个错误。正如报道所述,一个局部看似合理却缺乏视觉依据支持的词,可能使整句翻译偏离方向,且错误会在整句话中不断累积。该方法根据前一策略的置信程度,逐词调整强化学习被允许更新模型的范围:置信度高时收紧边界,接近0.2;置信度低时放宽边界,最高到0.3,并对带有负优势值的词元施加额外上限。其目的是阻止模型固守自信的猜测,同时为不确定的猜测留出空间,使其能够被拉回到视觉证据所支持的方向。 报道中的结果比标题所暗示的要窄得多,而这一差异很重要。在中文基准测试CSL-Daily上,所报告的提升是相对于另外两个同样基于姿态输入的命名系统而言的:相较Geo-Sign约提升1.26个BLEU-4,相较Uni-Sign约提升3.07个BLEU-4,其说法是在仅使用姿态输入的系统中取得最佳成绩,而非在整个领域中最佳。在美国手语基准测试How2Sign上,报告的数字为41.4 BLEU-1、15.2 BLEU-4和34.9 ROUGE-L,相较Uni-Sign的提升约为一个点或更少。本分析未能读到论文原文,因为托管论文的仓库需要浏览器验证步骤,因此以下内容审视的是该研究所指出的问题、其所处理的翻译方向,以及所提供证据的类型,而非对该系统本身作出评估。这些内容本身就值得审视,因为这个问题是真实存在的,其所涉及的翻译方向恰恰是各机构处理最不谨慎的方向,而所提供的证据类型也无法证明它被要求证明的东西。 翻译方向为何…
Read Now2026年9月2日发布于arXiv并被EMNLP主会议接收的一篇论文描述了DiscoSign,这是一个将英文文本翻译为美国手语(ASL)字符注释的框架,同时保持对已表达内容的追踪。其作者是来自Apple和Gallaudet University的研究人员,多家聚合媒体报道称该论文于9月11日出现在Apple的机器学习研究网站上,这也是该领域之外大多数读者接触到它的途径。其技术主张是狭窄且表述清晰的。大多数文本到手语系统一次只翻译一个句子,句子之间没有记忆,因此在一处被安放的指代对象可能在下一句中被悄然重新指派,同一概念可能在连续三句话中被三种不同的手势呈现,而组织手语话语的修辞结构也无法被选择,因为系统看不到话语整体。DiscoSign添加了跨句子持续存在的显式登记表,将其作为对模型的约束加以执行,然后据此验证并修正输出。 这是针对一个真实缺陷的真实进步,论文对其未能做到的事情也坦诚相待。而治理层面的重要性则更进一步。当一个系统在整篇文档中携带状态时,可能出错的单位就不再是句子。错误不再是独立事件,而开始成为整段文字的属性,而该领域已建立的评估方法——对句子逐一打分再取平均——无法看到这一点。风险不在于这项研究夸大了自身,而在于“具备话语意识”这个说法会先于任何人就如何检验话语是否真正被妥善处理达成一致,就已出现在采购文件中。 论文声称了什么,以及它对自身的说明 DiscoSign处理三种现象。第一种是空间共指:在ASL中,实体被指派到手语空间中的位置,随后通过指向该位置来回指,因此系统必须记住Alice被安放在左侧、Bob被安放在右侧。第二种是问答从句(Question-Answer Clauses),即打手语者提出一个修辞性问题并立即作答的话题—述题结构,这种结构在某些话语位置是恰当的,在另一些位置则显得生硬。第三种是概念—字符注释一致性,意味着一篇文档中出现五次的某个概念每次都应以相同的手势呈现,而不是在近义手势之间来回切换。每一种现象都由一个模块处理,该模块维护一个登记表,将其作为硬性约束提交给语言模型,然后检查返回的输出并就地修正违反之处。 论文报告称,与句子级基线相比,这大幅提升了空间一致性和实体追踪能力,同时保持单句质量不变,并且论文引入了自有的指标,因为正如其所言,标准机器翻译指标“无法捕捉话语层面的质量”。其局限性部分异常直率。该框架“通过字符注释处理手动手势的生成,但未纳入面部表情和韵律等非手动标记(NMMs),而这些标记在手语中承载着关键的语法和情感信息。”其三个数据集之一“缺乏真实的ASL标注”,因此部分话语层面的评估依赖于自动指标和回译。判定问答从句何时恰当的规则“无法体现”这一有时纯属风格问题的结构所具有的可选性。作者还指出,他们“与手语社群成员进行了合作”,并有Gallaudet的共同作者参与,这在该领域的文献中并非常态,应当予以明确指出。 一致性不等于准确性 使DiscoSign得以运作的机制,恰恰也是使其成为治理问题的原因,而这一点无法仅凭阅读摘要得出。一个登记表强制要求早期做出的决定被贯彻始终。如果该决定是正确的,整段文字便是连贯一致的。如果该决定是错误的,整段文字便以同样的方式全部错误。第二句中被指派到错误位置的指代对象,不会只产生一个坏句子;它会产生这样一份文档:此后每一次引用都自信地指向错误的人。被映射到不精确手势的某个概念,并非一次孤立的失误;而是这个手势被反复使用,系统的一致性机制还在主动阻止本可能因变化而引入的纠正。论文自身对该流程的描述称,“在字符注释阶段引入的话语层面错误会贯穿整个流程传播。” 句子级系统的失败是嘈杂的,而嘈杂的失败有一个未被充分重视的特点:读者会察觉到它。不一致性作为一种缺陷是可辨识的。而一个始终如一地犯错的系统,看起来就像是一个言之有意的系统。对于接收输出而非将其与原文核对的聋人读者而言,一个稳定但错误的指代对象根本不像是一个错误;它只是文档所写的内容而已。这颠覆了通常的假设,即更好的内部连贯性更安全。连贯性在降低错误可见度的同时,提高了犯错的代价,而任何逐句评分的平均值都无法显示这一点。 新指标衡量的是什么,以及是谁验证了它们 论文在这一点上颇为谨慎,这份谨慎值得细读,因为它决定了下游可以负责任地提出何种主张的上限。新指标衡量的是空间索引一致性、概念—字符注释映射的稳定性,以及问答从句使用的恰当性。三者中有两者衡量的是系统是否始终如一地做同一件事,这是就输出本身而言的属性,并非衡量聋人读者是否理解了这段文字。为验证这些指标,两名ASL流利的评审员对三十二个故事、共一百五十二个句子按五分制打分。空间一致性与他们的判断呈中等程度相关。概念—字符注释一致性也呈相关。问答从句恰当性指标未达到统计显著性,论文将此归因于评审员之间在何为此类从句这一问题上存在分歧,两者之间的加权一致性被描述为中等程度。 对于验证一项新指标的研究贡献而言,两名专家评审员是合理的设计,而对负面结果的坦诚也值得肯定。但作为机构部署的依据,这远远不够,论文本身也并未声称如此。若这项工作要走向采购环节,有三点区别至关重要。第一,将自动指标与专家对同一属性的评分相关联,并不等同于衡量聋人读者是否理解了该文档,而这一点目前尚无人在话语层面做到过。第二,“ASL流利”并非“聋人”的同义词,论文也未报告评审员的聋人身份、认证或背景。第三,当合格的评审员对某一语法结构是否存在都意见不一时,一项自动化评分断言其使用是恰当的,无论其给出何种数值,都尚不能算作一件保证性文件。 字符注释仍然不是语言 将此报道为手语人工智能已超越逐句翻译的说法,超出了实际所建成的内容。DiscoSign生成的是字符注释,一种代替手动手势的书面标签序列,而作者也直接说明未纳入非手动标记。在ASL中,论文试图保留的大量话语结构恰恰存在于那些渠道之中。话题标记、构成该框架所建模结构本身的问句与答句之间的边界、标示所表达视角归属者的角色转换、将某一指代与空间中某一位置相联系的目光注视:这些都由面部、头部和身体承载。字符串可以记录某个指代对象是索引j;它无法记录使该指代得以落实的目光注视。 作者意识到了这一点,并就此说了一些有用的话,即他们的登记表所保存的状态,已接近下游视觉系统生成非手动标记所需的信息,从该登记表推导出这些标注是自然而然的下一步。这是对未完成工作的一个清醒描述。它与一个能够生成连贯手语话语的系统并不相同,而这两者之间的距离,正是采购官员在阅读新闻摘要时会被误导之处。一位被告知供应商的流程“具备话语意识”的买家,理应有权询问这指的是哪个阶段,以及字符注释之后的下游环节是否保留了这一点。 那个未被点名的数据集 论文列出了三个数据来源:ASL…
Read Now按分钟计费的合成手语,以及当文件离开时留在原地的治理机制 2026年9月9日,Signapse推出了SignStream Chat,这是一款聊天式工具,用户输入一句英语句子,即可获得一段由AI生成的视频,视频中的数字手语者以英国手语或美国手语将其呈现出来,德国手语则被列为即将推出。每位用户每周可获得六十秒的免费翻译,并可通过按需付费的方式购买更多额度。与此同时,Signapse还公布了SignStream API的按分钟计费方案:每月使用不超过200分钟为每分钟2.00美元,不超过1000分钟为每分钟1.75美元,不超过4000分钟为每分钟1.50美元,输出平均耗时十五秒。三月份,该公司在宣布将于本月与流媒体集成商G&L合作推出德语手语者时——该产品本周正在IBC作为创新奖决赛入围项目展出——公司联合创始人Sally Chalk表示,“AI手语已不再是实验性的;我们可以把它交到人们手中。”SignStream Chat正是这句话的字面实现。 这次发布标志着市场格局的变化,值得精确说明究竟发生了什么变化。迄今为止,合成手语主要是通过机构选择并付费的安排触达聋人:铁路运营商的发车信息屏、广播机构的直播流、公共机构的网站。这些安排背后有一个可以提出疑问的买家,一份可以附加条件的合同,以及一个能够控制输出内容出现位置的提供者。SignStream Chat销售的是不同的东西。它按分钟向任何人出售一个文件,而这个文件可以流向任何地方。本文认为,Signapse所公布的治理机制——在该行业中已属较为完善——是为第一种安排而构建的,并不能延伸至第二种安排,而且这一差距是结构性的,并非某家公司的疏漏。 公司自己所宣布的推出内容 Signapse对新产品的局限性异常坦诚,这份坦诚在其他一切评价之前就应当得到肯定。SignStream Chat的发布公告指出,“由于SignStream Chat实时生成翻译,这些翻译在您收到之前并未经过我们翻译团队的审核”,并建议该工具“用于非正式和创意性用途,而非正式或高风险内容”。API页面的措辞更加直白。当被问及输出内容是否经过人工核查时,答案是:“没有,而这一点很重要。API完全由AI生成,没有人工语法核查或质量保证。”它将该服务描述为“不适用于正式、法律或官方用途”,“最适合非正式消息传递或测试新的无障碍理念”,并将正式工作引导至另一款经过审核的独立产品。在这一领域,很少有供应商如此坦率地说明自身产品的边界。 同一份公告描述了输出内容的去向。视频“可以以多种格式下载,随时可在社交媒体平台上分享、嵌入内容中,或用于任何需要手语无障碍服务的场合。”定价页面在API层级的功能列表中写道,“水印:无。”Signapse的技术说明文档指出,其数字手语者完全来自“聋人母语手语使用者”,在“明确书面同意”下使用,并遵循“商业场合形象使用报酬方案”,系统生成的视频“与真人手语者无法区分”。这些陈述单独来看都合情合理。但合在一起阅读,它们描述的是这样一款产品:其输出未经审核、逼真、没有任何可见水印、以真实聋人为原型,并且被设计成可以带离其制作环境。 为可控部署而设计的治理机制 Signapse发布了一份由其首席执行官签署的AI治理框架,其中大部分内容都相当审慎。其使用政策按行业划分,规定何时适合采用人工翻译或AI翻译,声明安全保障事项“始终由人工负责”,要求在现场互动的法律和医疗沟通中配备合格译员,并禁止AI在未经监管批准的情况下用于评估、评分或考试内容。其内部工作流程区分了经审核的输出与即时输出,规定“AI质量控制在交付过程中进行审核,即时AI则在交付后进行审核。”其标签承诺写道:“在我们能够掌控的范围内,我们将为用户标注AI生成内容(例如屏幕图标)。”其行为准则声明,“手语使用者应对其数字形象的使用方式保有自主权”,以及“AI生成的手语输出不得暗示获得任何个别手语者的认可、身份认同或署名权。” 这些控制措施无一例外都假设了一个新产品所不具备的前提:即Signapse或受合同约束的机构客户能够控制输出内容出现的位置。当客户的部署方式能够与某个行业相匹配时,行业矩阵可以约束使用行为;但它无法约束下载后的文件。当提供者能够撤下或替换发车信息屏上的片段时,交付后审核是一项有意义的保障措施;但它无法追回已发布到社交媒体账户或嵌入他人网站的副本。标签承诺本身就以“在我们能够掌控的范围内”为限定条件,而下载的文件就其定义而言正是控制权已经易手的情形。禁止暗示手语者认可的规定是一条关于输出内容的规则,但一旦输出内容成为独立存在的视频,唯一能够遵守这条规则的一方就是转发它的人。这一切并不意味着该框架并非出于真心。它意味着这是一个为部署场景而设的框架,如今却被套用在一款销售文件的产品上。 一个没有标签的逼真手语者 这一后果对那些形象被系统使用的人来说最为严峻。一位在社交媒体上看到下载后的SignStream片段的观众,所看到的正是该公司自己所描述的“与真人手语者无法区分”的内容,而根据定价页面提供的信息,也没有可见水印来告知他们事实并非如此。这些文件是否带有屏幕AI图标或嵌入元数据,在本分析所查阅的产品页面中并未说明,也未经测试核实。如果两者皆无,观众就无从得知那个看似在打手语的人从未说过那些话,而这些话是由一位可能根本不懂这门语言的匿名用户所选定的。授权使用其形象的聋人手语者是在书面同意和版税安排下这样做的,这已经比该行业大多数做法更为规范。但这份同意涵盖了什么范围,以及它是否考虑到了一款自助式工具——通过它,任何人都可以让他们“说出”任意句子并公开发布结果——Signapse在关于SignStream…
Read NowOn 9 September 2026, Agence France-Presse carried a report from a Nairobi secondary school for Deaf students on…
Read Now2026年重写版 Heather M. Grizzle 最初写于2010年。2026年重写,以表达我现在认为早先那篇文章想要表达的意思。 H.G. 威尔斯让一个视力健全的人进入一个没人能看见的山谷,这个人便以为这使他成为了主宰。Nunez 有谚语站在他这边,也有解剖学为他撑腰,结果两者都毫无用处,因为山谷里的人们已经建立起一个不需要视觉就能运转的世界,他们的观念体系里也没有任何东西能让他的眼睛构成优势。他们有的,是一个诊断。社区的医生断定,Nunez 脸上那两个奇怪的软球体正在刺激他的大脑,并提议将其摘除,说这是一个简单容易的手术,一位长者对此提议的回应是感谢上天有科学。这个笑话精准到位,而它其实并不是关于失明的。它关乎的是:当定义一个身体的权威完全掌握在没有那个身体的人手中时,会发生什么,以及当改变身体的技术能力披着善意的外衣到来时,会发生什么。我在读本科时读到这个故事,立刻认出了那间手术室,因为我曾经躺在那张手术台上。 我天生患有感音神经性、语前性耳聋。按常规顺序尝试过助听器,但毫无用处,我把每次听力测试的结果都理解为好消息,因为“失败”意味着这个世界依然安静。1988年,我的耳鼻喉科医生向我母亲介绍了人工耳蜗,之后的八年里,我一直在为此与她抗争,破坏那台设备使它无法工作,直接告诉医生我想把它从我脑袋里取出来,最后,在十六岁那年,用我拥有的第一辆车碾过了体外处理器。我从来无法在描述那个下午时不显得夸张,所以我只如实报告:那感觉不像是破坏行为。那感觉像是第一次,一个关于附着在我头骨上的设备的决定,是由我自己执行的。 我当时不理解的是——直到之后的二十年里我才逐渐能够说清楚——那台设备到达我身上的整个过程,几乎与医学毫无关系。它关乎的是分配方式。 第一次接触的时机才是决定性特征。在二十世纪九十年代初,一位美国家长是在诊室里、从医生口中得知孩子耳聋的,而就在同一场对话里,他们被推荐了一种设备。无论这种安排还有什么别的性质,它都是一个单一信息来源的渠道,且这个渠道恰恰在父母最痛苦的时刻打开。医生并不被要求介绍手语习得、聋人学校、聋人成年人,或早期语言接触的发展证据,而且通常也确实没有介绍,把这归咎于个别医生的恶意是不公平的,因为这种结构在成千上万家诊所中都稳定地产生了同样的结果。制造商曾遭遇过聋人成年群体有组织的抵制,转而发现听力正常的家长群体接受度更高——这些家长平均而言从未接触过一个聋人成年人。那一时期相当大比例的儿童植入手术是通过公共保险报销的,也就是医疗补助(Medicaid),这一细节我在2010年写错了,而它之所以重要,是因为它证明了这是一项在没有公共审议的情况下进行的公共支出。 相比之下,手术层面的问题几乎是次要的。决定早已由“谁先发言”的架构做出。 2010年,我曾试图援引《纽伦堡法典》来起诉这件事,而我现在想撤回这个论点,而不是重复它。该法典规范的是对人类受试者的实验,而1990年的儿童人工耳蜗植入是获批准的临床治疗,而非研究。援引纽伦堡让我表达出了自己感受之强烈,但同时也给了任何有能力的对手一句话就结束这场对话的机会。我所指出的伦理问题是真实存在的,但它属于另一套理论体系,而那套理论体系更有力。 儿科伦理学从不假装十个月大的婴儿能够表示同意。它区分了“父母许可”——这是真正授权对幼童实施治疗的依据——与一个发育中儿童的“赞同”,后者的意见随着能力的增长而获得更多分量。它认为,一个孩子持续的拒绝在道德上是有意义的,需要有正当理由才能被推翻,并且认为干预措施的不可逆性以及是否存在替代方案,都是判断这种推翻是否正当的重要因素。这正是适用于我所经历之事的框架。我不是一个无法回答的婴儿。我当时十岁,我回答了。有人问我是否想听见,我说不,而这个答案被记录为“不配合”,而非“信息”。一个持批评态度的读者应当面对的问题,不是婴儿如何表示同意,而是一个临床系统欠一个连续八年反复说“不”的孩子什么,以及这个系统竟然没有地方安放这个答案,这意味着什么。 我在2010年提出的那些医学论断也需要被纠正,而纠正它们对我没有任何损失,因为准确的版本对我当年论辩的对象来说更为不利。 关于脑膜炎,我在2010年曾问诉讼在哪里,仿佛答案显然是“根本没有”。但事实上,美国食品药品监督管理局在2002年7月24日发布了一份公共卫生通告,指出人工耳蜗与细菌性脑膜炎之间存在关联,含有定位器组件的植入设备当月即被自愿召回,次年发表在《新英格兰医学杂志》上的一项研究,追踪了四千多名六岁前接受植入的儿童,发现他们患肺炎球菌性脑膜炎的风险相较于普通儿童群体大幅升高。此后出台了疫苗接种和监测方案。因此,诚实的说法并不是伤害未被察觉,而是一整类设备被分发给儿童使用了多年,其风险是在事后才被界定并采取行动的,其时间线是由不良事件驱动,而非由事先的证据驱动。这是一个关于治理的发现,它比我当年想要指出的问题更具破坏性。 关于残余听力,我在2010年的说法过于绝对。植入手术未必会摧毁植入耳中所有的声学听觉痕迹,而手术技术与电极设计此后已经专门发展出保留残余听力的方法。残余听力的丧失仍然是一个公认且常见的结果。可以站得住脚的说法是:这一手术对该耳中现存的任何自然听力都带来重大、有时是彻底的风险,这种丧失不可逆转,而永久承受这一后果的人,是一个未曾被征询过意见的孩子。夸大其机制是没有必要的。谁做决定、谁承受后果之间的不对称,本身就足以说明一切。…
Read NowWhat the Delaware state file in the National Deaf Education Data Index found… Delaware was supposed to be…
Read Now