信函、简报和报告可以以其自身的排版方式显示。自动仅在您上方的设置均未另作要求时保持此效果。
Category
Deaf-Led AI Governance centers control over how AI systems are designed, trained, and deployed, ensuring that sign language and Deaf experience are treated as foundational inputs rather than post-production fixes. It addresses how data is sourced, how models interpret visual language, and how platforms determine visibility and interaction. Without this layer, accessibility remains reactive, inconsistently applied, and dependent on systems that were not built to understand the language they process.
This approach shifts the focus from features to structure. It examines who defines standards, who controls training data, and who is accountable for outcomes when AI systems misinterpret or misrepresent Deaf communication. It also considers how governance decisions affect risk across compliance, product performance, and user trust.
By embedding Deaf leadership into system design and oversight, Deaf-Led AI Governance establishes conditions where language integrity, cultural context, and accuracy are preserved at scale. The result is not simply more accessible technology, but systems that perform more reliably because they are built on complete, representative inputs rather than partial adaptations.
在CVG机场,一个AI手语翻译员向Deaf旅客提供了错误的时间和错误的列车信息。站台上的其他人得到的都是正确信息。而这段视频随后竟成了一则广告。
Read Now一些为聋人、盲聋人和重听居民提供服务的州办公室,只有寥寥数名工作人员,预算中几乎没有余地聘请外部专业力量。当这些办公室寻求帮助时,对话往往止步于费用这一关:没有缩减范围的可能,没有反提案,也没有人问办公室能以什么来代替现金支付。这并非讲述某一家公司或某一个州的故事,本文也不点名道姓。它提出了一个聋人社区经常向由听人主导的机构提出、却较少向自身专业群体提出的问题。 这个问题丝毫不否认聋人主导的公司获得报酬的权利。聋人专业人士长期以来一直在争取被当作专家获得报酬,而不是被当作志愿者来咨询,一家无限期免费提供服务的公司根本撑不到能帮助任何人的那一天。真正的问题更为具体,也更为棘手。建立在聋人语言、聋人生活经验和聋人社区信任基础上的专业能力,对孕育它的社区负有某种回馈义务,包括那些无法支付市场价格的社区。当一个资源匮乏的州办公室被拒之门外、却没有得到任何替代方案时,这份义务就没有得到履行,而这种拒绝本身也说明了这种专业能力如今究竟是为谁服务的。 最付不起钱的办公室,恰恰是最需要帮助的 State infrastructure for Deaf, DeafBlind, and hard of hearing residents is uneven. Massachusetts established a…
Read Now面孔即数据 在口语和书面语言技术中,训练数据与个人通常是可以分离的。一句话可以剥离其作者身份。一段声音可以被转换到说话者无法被辨认的程度,而话语本身依然完整。手语不允许这种分离,因为这种语言是通过身体来产生的。手部承载词汇,但语法则分布在面部:眉毛的位置标记疑问句,嘴型消除手势的歧义,头部倾斜和眼神注视确立指称和一致关系。一段面部被打了马赛克的打手语者录像,并不是一个去标识化的语言样本,而是一个被破坏了的样本。 This has a consequence that the machine learning literature has recognised for some time and the…
Read NowNOVARA CONSULTING GROUP · NCG SPECIAL ARTICLE The Coordinates of Trust A governance reading of Google DeepMind’s SL2T…
Read Now每一次AI部署都会把风险转嫁给某个人。在大多数情况下,风险落在最没有能力发现错误、也最没有权力提出质疑的人身上。 Heather M. Grizzle Novara Consulting Group 2026年8月17日 本月早些时候,我写过一篇关于Google DeepMind手语翻译研究的文章,并指出演示并不等同于证据。当时的反馈让我有所收获。几乎没有人反对这一区分的重要性。相反,许多人提出了一个显而易见的后续问题:如果演示还不够,那么谁应该决定一个系统何时才算足够优秀可以部署,当它出错时又该由谁来负责? 这个问题并非手语所独有。它是当前AI治理领域尚未解决的核心问题,而且它有一个值得直接使用的名字。姑且称之为问责缺口。 什么是AI问责缺口? AI问责缺口,是指一个系统能够做到什么,与当它把这件事做糟时,任何可识别的一方应当承担何种责任之间的距离。每当一个组织部署AI系统的速度,快过其建立起验证系统输出、听取受影响者意见、以及在输出有误时纠正或停止部署的机制的速度,这一缺口便会出现。 这一缺口首先并不是一个技术问题。模型的失败方式是可以预见的,工程师们通常也会坦率地承认这些失败模式。这个缺口是一个制度问题。各机构正在采购其无法评估输出的系统,将其部署到错误会带来后果的场景中,却没有保留任何切实可行的机制来查明系统是否正常运作。 能力、可靠性与问责是三种不同的证据 大多数采购讨论把这三者当作一回事。它们并不是一回事,而将它们区分开来,是机构采购方能做出的最有价值的一步。 能力证据表明系统能够在供应商所选定的条件下完成某项任务。演示、基准测试分数和试点录像都属于能力证据。它们回答的是“这是否可行”这个问题。 可靠性证据表明系统在采购方将实际遇到的各类人群、场景与条件下——包括供应商未曾选定的那些——的表现如何。分类细化的性能数据、独立测试以及实际部署中的错误率,都属于可靠性证据。它们回答的是“这出错的频率有多高,又是对谁而言”这个问题。…
Read Now8月12日,谷歌DeepMind宣布推出SL2T,这是一款多语言手语转文本模型,并已开始通过Pixel 11上的Gboard和实时转录(Live Transcribe)功能将其投入消费产品中。首个版本将美国手语(ASL)翻译成英语,计划支持更多设备和手语种类,DeepMind表示,该底层模型的训练数据超过10万小时,涵盖50多种手语。无论从哪个角度衡量,这都标志着手语人工智能跨越了一条重要的界线:从研究实验室走向了普通人可以随身携带的产品。 这一跨越意义重大,但不应被误解为其他事物。技术上的突破与经过验证的部署是两回事,而当所涉及的技术处理的是一个历史上被边缘化的语言社群所使用的自然语言时,这一区别就显得尤为重要。SL2T现在提出的问题不是模型在演示中是否有效,而是其背后的证据能否承受这次部署将施加于其上的重压。 功不可没之处 这次发布不应被简单归入科技公司在没有听障人士参与的情况下为听障人士打造产品的老套故事中。据谷歌DeepMind介绍,听障人士全程参与了该项目,从概念构思、数据收集到用户研究和影响评估。该公司还成立了人工智能手语顾问委员会(AISLAC),其成员包括与全国聋人协会、罗切斯特理工学院国家聋人技术学院、聋人专业艺术网络以及世界聋人联合会有关联的代表。随发布同时,DeepMind与AISLAC联合发布了一份影响评估报告。 该报告做了一件在手语人工智能领域仍属罕见的事情:明确指出该系统不应在哪些场合使用。SL2T 1.0被明确描述为一种低风险的辅助输入工具。它未曾被设计或验证用于医疗保健、法律诉讼、教育、就业决策、政府福利认定或其他高风险场景,报告明确指出,该技术不应替代合格的手语翻译员,也不应成为机构规避无障碍义务的手段。这就是治理,理应得到认可。但这也仅仅是治理的开始。 基准测试是证据,但不是完整的证据基础 DeepMind报告称其表现强劲。在FLEURS-ASL测试中,SL2T据称取得了70分的零样本BLEURT分数,高于此前任何已报告的结果,此外还在PRESTO-ASL(一种单手版FLEURS-ASL变体)和FSboard指拼数据上进行了进一步评估。该公司还与听障谷歌员工进行了发布前测试,与听障参与者开展了外部日记研究,并由北美地区的AISLAC成员进行了实际操作评估。这些都是有意义的证据形式,都不应被轻视。 但正是在这里,公众对人工智能的讨论往往变得不够精确,因为已证实的性能表现并不等同于全面的验证。一个模型可以在选定的基准测试中表现出色,同时在不同人群、环境、语言变体、手语风格、设备和使用场景中仍存在严重缺陷。DeepMind自己的报告也承认了这一点。该模型在处理语法复杂性、非手部标记、地区性手语、多义手语、指拼、专有名词、非常规摄像头位置、弱光环境、俚语以及较长的对话语境时都可能遇到困难。它还可能生成错误的“幽灵文本”,或在打手语者尚未完成表达之前就仓促给出预测性猜测。 这些都不是无关紧要的边缘情况。面部表情、头部动作、空间结构、分类词以及地区差异和话语语境,并非手语的装饰性元素,而是手语本身。一个系统若能很好地处理引用形式的词汇,却在面部和打手语空间所承载的语法方面步履蹒跚,那它并未真正解决手语翻译问题;它只解决了其中一部分,而未解决的那部分,会不成比例地落在不同的打手语群体身上。 接下来的问题是数据细分 正是这种不均衡,使得下一阶段的证据工作变得至关重要。DeepMind承认,目前尚未针对年龄、性别、种族、地区、社会方言以及黑人美国手语(Black ASL)等变量对基准测试表现进行充分的数据细分。报告还指出,针对患有运动障碍或动作模式非典型的打手语者所开展的正式评估仍然有限,且该模型既未针对18岁以下儿童进行训练,也未对其进行正式评估。 一个汇总性能数字无法告诉我们该系统对黑人美国手语使用者的服务是否与对其他人群同样出色,无法说明它如何处理高度地区化的手语,也无法说明准确率在不同年龄群体间如何变化。它无法告诉我们该模型对肢体差异、震颤、脑瘫、关节炎或其他影响动作的病症患者表现如何,也无法说明准确率是否会随摄像角度、光线、肤色对比度、打手语速度、打手语空间或设备而变化。它无法区分那些仅仅改变措辞的错误与那些改变含义的错误。它更无法回答隐藏在这一切之下的问题:谁来决定何种程度的错误是可以接受的,以及对谁而言可以接受。最后这个问题,无论工程团队多么能干,都无法由其自行裁定。 参与不等于独立验证 还有一点值得细究。AISLAC是一种有意义的治理机制;听障组织的参与、用户研究以及联合影响评估都很重要。但顾问性参与与独立技术评估发挥的是不同的功能。目前公开的证据由开发方自行进行的评估、在项目自身治理架构内组织的用户和顾问所参与的测试,以及由谷歌DeepMind与AISLAC参与者共同撰写的报告构成。这是一个真实的证据基础,但它并非独立复现。…
Read Now第五参数 Novara Consulting Group · Novara Press · 无障碍人工智能治理与证据期刊 《第五参数》第1卷·第13期 作者 Heather M. Grizzle ORCID 0009-0005-2605-8256 证据日期 截至2026年8月…
Read Now执行摘要 无论是为识别、翻译还是基于虚拟人形象生成而构建的手语人工智能,在结构上都依赖于对Deaf和重听用户进行视频或生物特征采集。这种依赖性造成了一个数据治理问题,而这一问题所受到的机构审查远少于本系列此前几期所记录的语言和理解层面的失败。在NCG依据SLAT(Sign Language Access Trust)框架审查过的供应商范围内,关于收集了什么数据、数据保留多久、是否被用于训练未来模型、以及是否与第三方共享等方面的披露,情况充其量是参差不齐,最坏情况则是完全缺失。这并不是在声称任何特定供应商存在恶意行为。现有公开证据尚不足以将意图归咎于任何具名公司,本期内容也并不作此归咎。这是在指出:市场尚未形成与所涉数据敏感性相匹配的披露标准,而这一缺口是一种治理失败,与任何单个供应商的行为无关。下文提出的政策立场认为,同意与披露的充分性应被视为采购环节的准入门槛,而非在功能评估之后才考虑的次要事项。 政策问题 手语采集本质上就是生物特征采集。手语使用者手部动作、面部语法及身体姿态的视频,并非类似于提交给文本系统的一句打字文本那样的附带性输入。它具有独一无二的可识别性,其定义本身就编码了残障状态信息,而在许多司法管辖区,它符合受到更高保护的生物特征数据或特殊类别数据的法定定义。例如,伊利诺伊州的《生物特征信息隐私法》(BIPA)要求在采集生物特征标识符之前必须提供书面通知并获得同意,并且不以证明实际损害为前提即可追究责任。欧盟《通用数据保护条例》(GDPR)将揭示与残障相关的信息以及用于身份识别的某些生物特征数据,归类为第9条下的特殊类别数据,要求在普通同意之外提供明确的法律依据。加利福尼亚州的《消费者隐私法》(CCPA)与《隐私权法》(CPRA)也对生物特征信息施加了各自的披露与选择退出义务。 尽管存在上述监管环境,面向消费者的手语人工智能产品却往往依赖于并非针对Deaf用户或生物特征采集而拟定的通用服务条款。NCG所做的供应商快照调查中反复出现三类缺陷:其一,没有单独或显著的披露说明视频输入构成受特定法定保护的生物特征数据;其二,没有明确说明所采集的视频或由此衍生的特征是否被保留用于模型训练,若是,保留多久、享有何种删除权利;其三,没有以无障碍格式进行披露,也就是说,同意条款本身往往未被翻译成ASL,或未以数据被收集人群可使用的格式呈现。最后这一点并非细枝末节。一种要求以书面第二语言具备读写能力才能理解自身生物特征数据将被如何处理的披露机制,对于英语读写能力参差不齐、且以ASL作为主要理解语言的人群而言,并不能真正构成知情同意。 机构分析 造成这一缺口的机构性动因是结构性的,而非阴谋性的。手语人工智能仍是一个年轻的产品类别,大多数供应商是小型公司,使用的是整个软件行业通用的隐私政策模板,即便有所调整也十分有限。与此同时,机构层面的采购流程历来是依据功能性标准来评估这些产品:虚拟人形象呈现是否清晰可辨,识别系统是否达到可接受的准确度,供应商在开发过程中是否有Deaf员工参与。数据治理则被当作法律或IT合规问题,在实质性采购决策之后才加以处理,如果有处理的话。这种先后顺序本身就是真正的治理失败。等到数据治理方面的缺陷显现出来——无论是通过数据泄露、监管调查,还是来自数据被采集的Deaf社群的公开批评——机构关系与财务承诺早已确立,此时要求补救的筹码相应也就更弱。 此外还存在一个与同意问题相邻、但在分析上有所区别的训练数据来源问题。有若干手语人工智能系统部分建立在取自公开发布内容的视频语料库之上,其中包括Deaf ASL使用者及教育工作者在社交平台上创作的内容。这种使用是否落在平台自身服务条款的范围之内,是否构成版权法意义上的合理使用,以及那些手语出现在相关素材中的个人是否曾被切实告知其内容将被用于训练商业人工智能系统,这些都是尚未解决的问题——NCG尚未就任何特定供应商对此进行独立核实,本文在此也不将其断言为既定事实。就治理而言,关键在于:评估这些系统的采购官员几乎无从了解训练数据的来源情况,而当前行业内的披露规范也并未要求供应商提供此类信息。 治理影响 一家采购手语人工智能的机构,并不仅仅是翻译工具的购买者。当该系统处理学生、患者、员工或公众的实时视频时,该机构在大多数适用的隐私框架下同时也是数据控制者或处理者,并且无论其供应商的数据处理暴露风险在购买时是否已被披露,该机构都会承接这种暴露风险。一家在部署前未对供应商的数据收集、保留及训练使用做法进行核实的机构,无法向其自身的利益相关方、监管机构,或数据被采集的Deaf个人声称自己已履行了数据保护义务。无论供应商实际行为如何,这一点都成立,因为缺乏经核实的披露本身就是治理缺陷,与任何特定供应商是否最终被证明在负责任地处理数据无关。 NCG政策立场 NCG的立场是:数据治理与隐私披露的充分性应在手语人工智能采购中发挥准入门槛的作用,应在功能表现评估之前而非之后加以评估。若供应商无法就所收集的生物特征数据种类、保留期限、是否以及如何用于模型训练、以及存在何种删除权利,提供清晰、可通过ASL获取、符合司法管辖区要求的披露,则应被视为不具备机构部署资格,无论其在评估其他方面的语言或技术表现如何。这一立场已经在SLAT框架的“数据治理与隐私”以及“透明度与披露”两个领域中得到落实,本期内容主张,鉴于机构所面临的法定风险暴露,以及不可及的同意语言对受影响人群造成的理解障碍,这些领域相对于该框架当前的权重设定,理应获得更高的权重。 实施考量 评估手语人工智能的采购官员应要求供应商作为响应条件,提供涵盖上述四项要素的书面数据治理披露文件,要求该披露除书面英文版本外还应提供ASL视频格式版本,并将供应商拒绝或无法提供此类披露视为不利认定,与系统的功能表现无关。已有部署的机构应开展回溯性审查,而非等到合同续签时才处理,因为治理风险暴露是从部署之日起累积的,而非从发现问题之日起累积。若无法核实供应商训练数据的来源,机构应要求就数据来源的合法性提供合同保证,而不应将无法获得答复视为中性的未知状态。…
Read Now执行摘要 为通信无障碍而采购人工智能系统的机构越来越自信地认为自己已经妥善管理了风险,而这种自信也越来越站不住脚。这种自信建立在各种文件之上:填写完成的核对清单、供应商文档、脚本化的演示、经过谈判的保修条款、备案的无障碍声明。每一份文件都是真实的。但无论单独看还是合起来看,它们都不是为了回答机构真正需要回答的问题而设计的,那个问题是:该系统在其被采购用于的部署环境中,是否能够安全、可靠、恰当地运行。 本期将这种状况称为“采购剧场”,并论证这是结构性问题,而非出于恶意。采购专业人员因程序上的完整性而受到嘉奖。供应商则因具有说服力的演示而获得回报。双方都可以完全履行各自的义务,而核心的性能问题却始终无人审视。补救之道不在于更多的文件材料,而在于将治理标准从“程序性保证”——询问是否采取了所要求的步骤,转向“证据性保证”——询问所收集的证据是否有能力发现真相。 Novara Consulting Group的立场是:这一区分将成为公共部门人工智能治理的核心能力,各机构应当从现在开始建立这种证据能力——在部署之前,而不是在失败之后。 政策问题 治理的衡量标准不是活动本身,而是所进行的活动是否有能力发现真相。当前大多数无障碍人工智能采购未能通过这一检验,原因不在于流程草率,而在于这一流程本是为另一类产品设计的。 传统的采购工具假定产品的能力是稳定的、可观察的,并且在很大程度上由制造商自行披露。在这一假设下,收集各类文件是验证性能的合理替代方式。而在语言无障碍领域中介的人工智能系统,却违背了这一假设的每一个部分。系统的表现因手语使用者、语域、地区差异、光线、摄像机几何角度、延迟、主题内容,以及本刊物名称所指的非手动语法特征的有无而各不相同。一个在受控演示中表现尚可的系统,在临床问诊、纪律听证或紧急通信场景中可能大幅退化。而标准文件包中的任何内容都无法揭示这种退化。 三种混淆维持着这一问题。文档被当作验证,尽管文档记录的是供应商的主张,而非系统的实际表现。认证被当作性能,尽管认证通常证明的是流程的合规性,而非产出的质量。合规被当作有效性,尽管合规衡量的是与技术标准的一致性,而非聋人或听障用户是否实现了功能性的沟通无障碍。一个无法区分这三个概念的采购流程,所产生的机构风险与其填写的表格数量成正比,因为每份填写完成的表格都在增加信心,却并未增加知识。 机构分析 解释这种模式持续存在的原因,激励结构比任何“恶意论”都更有说服力。采购部门在审计制度下运作,该制度审查的是所要求的步骤是否已经执行,而非这些步骤在认识论上是否充分。一份包含供应商无障碍合规报告、演示记录以及经协商合同条款的档案能够通过审计。而一份记录了机构独立针对具有代表性的聋人用户、在具有代表性的条件下测试了该系统、并发现其存在不足的档案,则会带来进度风险和政治风险。这一体系奖励的是前者。 供应商面临的是对称的激励结构。无障碍人工智能市场奖励的是演示质量、叙事的连贯性以及签约速度。供应商很少被要求披露失败情形,而单方面披露这些情形会带来竞争上的代价。目前尚无公开证据支持“现有商用手语人工智能系统已在独立构建的、具有部署代表性的测试条件下接受评估并公布结果”这一说法。在缺乏此类证据的情况下,营销宣传和自行生成的文档便默认成为机构记录。 受影响的群体承担了剩余风险。聋人和听障用户通常不是采购的当事方,极少参与验收测试,只有在机构信心已经建立、合同已经签署之后,他们才会接触到该系统。到那时,举证责任已经发生倒置:用户被要求证明系统存在故障,而与之对立的是机构记录所声称的“已尽职调查、系统被认定合规”。这种倒置正是采购剧场造成的实质危害,而它完全是由遵循合法程序的合法行为者所造成的。 以政府工具传统的视角来理解,采购并非行政形式,而是一种公共行动工具,而工具的选择决定了谁有权发言、什么可以作为证明、以及问责最终落在何处。结合因果叙事文献来看,当前关于无障碍人工智能失败的主流叙述是一种“意外”的故事,即不可预测的技术偶尔表现不佳,而没有任何行为者需要承担责任。本文所倡导的证据性框架支持另一种解读——至少是“疏忽”的叙述:这些失败是可预见的,导致其发生的条件是可以事先发现的,而选择不去查看,本身就是一种治理决定。 治理影响 从程序性保证转向证据性保证,要求机构提出一套不同的问题,并将这些问题的答案视为验收标准,而非背景信息。所提出主张的支撑证据是什么,这些证据是性能证据还是流程证据?证据是由谁生成的,该方与结果之间存在何种商业关系,其方法透明度如何?该结果能否由与采购结果无利害关系的一方独立复现?系统在何种具体条件下会失败,失败率是多少,在不同用户群体中严重程度的分布又如何?当这些失败在部署中发生时,由哪一方承担责任,通过何种机制、在何种时限内承担,受影响个人又能获得何种补救? 这些问题所做的远不止提高证据门槛,它们还重新分配了问责归属。一份能够回答这些问题的采购档案,确立了机构知道了什么、何时知道、以及机构接受了什么。而一份无法回答这些问题的采购档案,只能证明机构完成了一个流程。在新兴的治理预期之下——包括要求组织明确使用情境并记录剩余风险的基于风险的框架——后一种档案将越来越难以自圆其说。…
Read Now公共采购的历史,在某种程度上可以被解读为文件信任的历史。政府很少在审查源代码之后才采购软件。大学不会独立检查学习管理系统所声称的每一项安全控制措施,医院也不会例行重新进行医疗软件供应商已完成的无障碍测试。采购依赖的是介于采购方与产品本身之间的文件陈述。认证、技术报告、审计结果、符合性评估以及无障碍符合性报告之所以存在,正是因为直接验证成本高昂、专业性强,且往往不切实际。因此,机构购买的不仅是产品,还有为这些产品提供支持的证据。 这种安排一直都需要判断力。VPAT从来都不是为了证明无障碍性确实存在而设计的。它被设计为供应商依据公认无障碍标准进行评估的结构化呈现。采购官员即便高度依赖该文件本身,也理解这一区别。该报告之所以具有分量,并非因为它拥有独立的法律权威,而是因为编制该报告通常需要有人投入大量时间对产品进行评估。制作该文件所投入的努力,尽管并不完美,却成为了制作背后证据所投入努力的一种代替指标。 生成式人工智能在不改变文件外观的情况下,破坏了这种关系。 一个机构现在能够在极短的时间内,制作出技术上流畅、内部逻辑一致、格式专业且具有说服力的无障碍文件。标准被正确引用,技术术语被恰当使用,其结构与采购官员在过去二十年间审阅过的数千份符合性报告如出一辙。然而,这些特征都无法揭示该文件究竟反映的是广泛的无障碍测试、有限的内部审查,还是根本没有任何有意义的评估。写作的精巧程度,正日益与证据的可靠程度相脱节。 这并非反对人工智能的论点。文件编制历来就是一种翻译行为。工程师将软件行为转化为技术性发现,无障碍专家将这些发现转化为采购语言,采购官员再将技术语言转化为采购决策。生成式人工智能只是加速了这一翻译过程中的某一环节。困难出现在翻译被误认为是验证之时。一份写得很好的报告可能准确描述了一项严谨的评估,但也可能描述的是从未经独立审查的假设。文件本身并不能提供可靠的方式来区分这两种可能性。 其后果比乍看之下更为深远。采购文件中现在包含的文件,往往在外观上大体相似,尽管它们所代表的证据基础可能截然不同。一份无障碍符合性报告可能总结了由经验丰富的无障碍专业人员采用自动化与人工相结合的方法所进行的独立测试;另一份可能只代表从未经过外部审查的内部工程评估;第三份可能准确记录了广泛的测试,同时借助生成式人工智能来提升条理与可读性;第四份则可能几乎完全根据产品规格说明和营销材料生成,而底层软件从未真正依据无障碍标准接受评估。一旦被简化为一份格式专业的报告,这些文件尽管基础迥异,却在采购记录中占据着同样的证据空间。 因此,传统的采购问题已不如从前那样有用。多年来,无障碍评估的核心在于产品是否符合技术标准。然而,越来越重要的问题在于该结论所依据的基础是什么。当制作有说服力文件的成本已大幅下降时,符合性声明的存在本身已不再具有多大的说明意义。采购官员反而需要了解该声明本身的来源信息:由谁进行了评估、采用了哪些方法、自动扫描是否辅以人工测试、辅助技术用户是否参与其中、结论是否可被独立复现,以及支持性证据是否仍可供外部审查。这些问题关乎证据而非无障碍本身,但它们却日益决定着无障碍声明是否值得机构信赖。 近期的采购指南已开始反映这一更广泛的转变。公共部门指南不再将文件提交视为尽职调查的终点,而是日益强调实证性、可复现性、方法透明度以及独立验证。因此,一份无障碍符合性报告的意义,与其说在于其存在本身,不如说在于它能否引导采购官员找到经得起有意义审查的证据。该报告之所以有价值,并非因为它宣称合规,而是因为它解释了为何这一宣称应当被采信。 其影响远远超出无障碍采购的范畴。人工智能已大幅降低了在几乎所有治理领域中制作有说服力的机构文件的成本。安全评估、风险分析、治理声明、实施计划、隐私文件以及采购叙述,都可以以日益流畅的方式、以日益减少的努力起草完成。然而,这些文件所依赖的实际工作,却依旧难以获得同等程度的加速。独立测试仍需合格的评估人员,验证仍依赖可复现的方法论,证据依然源自观察而非撰写。由此产生的失衡因而是结构性的,而非技术性的。陈述的生产速度,已远远超过了这些陈述所描述之事实的生产速度。 正是在这样的背景下,证据治理变得日益重要。手语无障碍信任框架(Sign Language Access Trust,SLAT Framework)的开发前提是:文件不应脱离产生它的机构流程而被独立评估。该框架并不将供应商的声明视为自证成立,而是审查治理结构、验证方法、透明度做法、披露质量,以及支持性证据的来源。核心问题不在于是否作出了某项声明,而在于是否存在足够的证据,使一个理性的采购方能够在做出影响无障碍性、公共支出及法律问责等重大决策时,合理依赖该声明。 公共采购长期以来依赖文件性证物,因为机构无法独立验证呈交给它们的每一项技术性主张。这种依赖不太可能消失。发生改变的,是文件与制作该文件历来所需投入的努力之间的关系。随着人工智能持续降低具有说服力的技术写作的成本,采购实践必将更加重视支撑这些文件的证据的质量、可追溯性与独立性。无障碍采购未来的可信度,将不再主要取决于符合性报告的精巧程度,而是取决于各机构区分文件陈述与可证实事实的能力。 作者说明 Heather M.…
Read Now