O facto mais importante sobre IA e língua gestual em 2026 não é o que aconteceu.
Entre janeiro e agosto, empresas anunciaram produtos, demonstraram sistemas, angariaram fundos e falaram sobre o futuro da comunicação. Novas ferramentas foram apresentadas como mais rápidas, mais capazes e mais próximas do uso quotidiano. Algumas atraíram manchetes entusiásticas. Outras chegaram com alegações impressionantes sobre dados de treino, tempos de resposta ou o número de sinais que conseguiam reconhecer.
O que não apareceu foi evidência independente de que estes sistemas funcionavam conforme anunciado. Nenhuma terceira parte publicou uma medição pública de precisão, taxas de erro ou compreensão do utilizador para qualquer um dos principais sistemas examinados pelo Índice. Pesquisas nas fontes exigidas não encontraram nenhum teste de desempenho independente para Signapse, Sorenson AST, Rylo Sign, Sign-Speak, ChatSign, SignVrse, Talksign ou o SignGemma da Google.
A formulação formal da conclusão é cuidadosa: nenhuma evidência de Classe A foi "localizada até agosto de 2026". Isto deixa em aberto a possibilidade de que alguma evidência exista algures fora do registo público. Pode estar dentro de uma empresa, na posse de um cliente ou contida em investigação ainda não publicada.
Mas evidência que não pode ser examinada não pode sustentar uma alegação pública. Esta distinção importa porque a indústria não tem estado silenciosa. Tem produzido um fluxo constante de anúncios, parcerias, demonstrações e histórias de financiamento. A impressão é de progresso rápido. No entanto, a evidência pública necessária para avaliar esse progresso não tem acompanhado o ritmo.
Um campo pode estar ocupado sem se tornar responsável. Pode gerar notícias sem gerar conhecimento.
## Três tipos de evidência
O Índice separa a evidência em três classes amplas.
Isto não significa que toda alegação de Classe B ou Classe C seja falsa. Uma empresa pode descrever o seu produto com honestidade. Uma equipa de engenharia pode reportar um resultado real. Uma demonstração pode mostrar progresso técnico genuíno. O problema é que nenhuma destas coisas responde à questão central: como é que o sistema se comporta quando alguém sem interesse no seu sucesso o mede?
Em 2026, quase todo o julgamento público sobre IA e língua gestual ainda dependia de material de Classe B ou Classe C. As empresas forneceram as alegações, a linguagem e, muitas vezes, as medidas pelas quais essas alegações eram compreendidas. A avaliação independente estava largamente ausente.
## O problema do SignGemma
O SignGemma da Google oferece o exemplo mais claro. Quando foi anunciado, o modelo atraiu atenção porque parecia colocar os recursos de uma grande empresa tecnológica por trás da IA para língua gestual. As alegações associadas a ele incluíam treino em 10.000 horas de dados e latência abaixo de 200 milissegundos. Estes números viajaram amplamente porque sugeriam tanto escala como velocidade.
Quinze meses depois, o modelo ainda não tinha sido oficialmente lançado. Funcionários da Google confirmaram isto no Fórum de Programadores de IA da empresa. A discussão continuou ao longo de junho de 2026. Investigadores do Paquistão, Egito e outros locais pediram acesso. Não o receberam.
Isto criou um objeto público invulgar: um modelo que podia ser discutido mas não testado, citado mas não inspecionado, antecipado mas não utilizado. Sem acesso ao modelo, pessoas de fora não conseguiam reproduzir os seus resultados reportados. Não conseguiam examinar como os seus dados de treino tinham sido reunidos, testar o seu desempenho em diferentes línguas gestuais ou descobrir como se comportava fora de exemplos controlados. As alegações sobre escala de treino e latência permaneceram, portanto, Classe C.
A reputação da Google não altera o seu estatuto. A autoridade pode tornar uma alegação mais persuasiva, mas não a torna independente. A repetição não transforma uma afirmação numa medição. A questão não é que o SignGemma deva ter falhado. A questão é que ao público não foi dada nenhuma forma fiável de saber se tinha sido bem-sucedido.
## Precisão não é um único número
O teste independente é particularmente importante na tecnologia de língua gestual porque a palavra "precisão" pode ocultar tanto quanto revela. Um sistema pode ter um bom desempenho num vocabulário limitado gravado em iluminação estável, mas ter dificuldades numa conversa natural. Pode reconhecer sinais de pessoas cuja aparência se assemelha à dos dados de treino, enquanto tem um desempenho fraco para outras. Pode identificar sinais individuais corretamente mas perder o significado ao longo de uma frase. Pode funcionar para uma língua gestual e ser promovido como se funcionasse para a língua gestual em geral.
As línguas gestuais não são versões codificadas de línguas faladas. Têm a sua própria gramática, variação regional e contexto cultural. O significado pode depender do movimento, localização, tempo, expressão facial e a relação entre sinais. Um sistema que reconhece as mãos mas perde o rosto pode produzir palavras enquanto perde a frase. Mesmo uma taxa de precisão de destaque elevada diria pouco a menos que soubéssemos o que tinha sido testado, quem tinha participado e o que contava como resultado correto.
O sistema foi testado em sinais isolados ou em conversação contínua? Os participantes eram familiares ao modelo? Os signatários Surdos julgaram se o resultado fazia sentido? Os erros foram apenas contados, ou foram examinados quanto a possíveis danos? O teste incluiu diferentes idades, tons de pele, estilos de sinalização e variedades regionais? Estes não são detalhes secundários. Determinam o que o número significa.
É por isso que os estudos de compreensão importam a par dos testes de referência técnicos. Um sistema pode alcançar uma pontuação impressionante enquanto ainda produz resultados que os utilizadores consideram confusos, pouco naturais ou enganadores. O teste final não é se um modelo deteta movimento. É se as pessoas conseguem compreender e confiar no que ele comunica.
## O custo da antecipação
A promessa repetida de que um sistema eficaz está prestes a chegar tem consequências. Um modelo não lançado pode ocupar espaço que serviços funcionais poderiam de outra forma preencher. Pode moldar decisões de financiamento, influenciar discussões políticas e encorajar instituições a adiar o investimento na prestação humana. Pode fazer com que as deficiências atuais pareçam temporárias, mesmo quando nenhum calendário ou evidência pública sustenta essa crença.
Esta é a política da antecipação. A ajuda está sempre a chegar, pelo que a ausência de ajuda no presente é tratada como menos urgente. Para os utilizadores Surdos, o custo é prático. Um hospital, universidade, empregador ou autoridade pública pode apontar para tecnologia emergente como evidência de que a acessibilidade está a melhorar. Mas um anúncio promissor não pode interpretar uma consulta médica. Uma demonstração não pode garantir acesso a uma sala de aula. Um modelo indisponível para investigadores é também indisponível para as pessoas cujas vidas são usadas para justificar a sua importância.
Há outro custo. Quando a atenção pública se concentra em sistemas que não foram testados independentemente, organizações mais pequenas que oferecem formas de apoio menos dramáticas mas mais fiáveis podem desaparecer de vista. Intérpretes humanos, serviços liderados pela comunidade e práticas de acessibilidade estabelecidas raramente recebem o mesmo entusiasmo que um novo modelo de IA. São julgados como despesas presentes, enquanto a tecnologia é valorizada como possibilidade futura. A comparação é desigual. A prestação existente tem de responder pelas suas limitações agora. Ao sistema prometido é permitido permanecer perfeito porque ainda não chegou.
## O que a transparência exigiria
A ausência de evidência independente não é difícil de corrigir em princípio. Os programadores poderiam fornecer a investigadores qualificados acesso antes de fazer alegações de desempenho amplas. As avaliações poderiam ser concebidas com signatários Surdos em vez de meramente conduzidas sobre eles. Conjuntos de teste, métodos e definições poderiam ser publicados. Os resultados poderiam ser desagregados por língua, contexto e grupo de utilizadores em vez de comprimidos num único número de destaque.
Os investigadores também deveriam poder relatar falhas sem depender da permissão da empresa avaliada. Nada disto eliminaria a incerteza. Estudos independentes podem estar mal concebidos. Os testes de referência podem recompensar formas restritas de desempenho. Os resultados publicados podem tornar-se desatualizados à medida que os sistemas mudam, ainda assim um escrutínio imperfeito é melhor do que uma visibilidade gerida. Um teste de referência público dá aos outros algo para questionar, repetir ou melhorar. Uma alegação sem sustentação dá-lhes apenas algo para divulgar.
A transparência também significaria ser claro sobre o que um sistema não consegue fazer. Um produto concebido para um contexto restrito não deveria ser descrito como uma solução geral. Um modelo testado numa língua gestual não deveria ter permissão para apropriar-se da aparente universalidade da palavra “gestual”. Um protótipo deveria ser identificado como protótipo. Um modelo não divulgado não deveria ser tratado como infraestrutura pública.
## The Fifth Parameter
Technical systems are often judged by familiar measures: speed, scale, cost and accuracy. The missing measure is trust. Trust is not another performance claim. It is the result of making claims testable. It grows when outside researchers can inspect a system, when users can describe its failures and when evidence remains available after the announcement cycle has moved on. This is the fifth parameter.
Segundo essa medida, o campo da IA de língua gestual entrou em agosto de 2026 com um sério défice. Tinha produtos, promessas e publicidade. O que não tinha era evidência independente disponível publicamente para os sistemas que atraem mais atenção.
Essa ausência não deve ser confundida com uma lacuna temporária de papelada. Faz parte da condição atual da tecnologia. Até que avaliadores independentes possam medir estes sistemas, a resposta honesta a muitas perguntas sobre o seu desempenho não é que funcionam, nem que falham.
It is that the public has not been given enough evidence to know.
Declaration of interests: The author is founder of Novara Consulting Group LLC, which builds and licenses the Sign Language Access Trust Index referenced in this article, and edits The Fifth Parameter.
Funding: None. Produced internally by Novara Consulting Group.
Data and materials: The article draws on the public record for the systems named and on the Google AI Developers Forum thread concerning SignGemma.
AI use disclosure: The text of this article is the author’s own. AI assistance was used only for typesetting into the branded master; no argument, figure, quotation or citation was generated by the model.