Na crónica de há duas semanas escrevi sobre o incidente da Hugging Face e o alinhamento da indústria em torno do discurso da desaceleração da oferta inovadora em IA. Nessa crónica, apenas aflorei de passagem um aspeto que, a meu ver, merece mais atenção, por ter uma importância nuclear no futuro da IA, sobretudo no plano geopolítico, e que se prende com o edifício das salvaguardas – designadas tecnicamente de “guardrails” – que os fabricantes construíram – supostamente – para nos proteger do mau uso. A prática, porém, está a ter resultados perversos, já que este tipo de guardrails está a empurrar os utilizadores mais qualificados ou que precisam de flexibilidade, por razões perfeitamente válidas, a recorrer a modelos chineses. É sobre isto que quero falar hoje, por ser uma das maiores lições que a indústria da cibersegurança aprendeu com a análise do famoso ataque de agentes à Hugging Face.

Fazendo um “flashback”, há que recordar que a Hugging Face, à altura, terá detetado movimentos estranhos nos pedidos de acesso, tendo, com isso, percebido que estava a ser atacada por agentes autónomos que se moviam a uma velocidade significativa, encadeando vulnerabilidades e obtendo privilégios de administrador em clusters inteiros. Perante este movimento invulgar, a equipa de cibersegurança da Hugging Face fez o que se recomenda nestes casos: alimentou os modelos comerciais com o código do ataque e com mais de dezassete mil eventos (“logs”) que os atacantes deixaram para trás.

Ora, num momento essencial para a empresa, os modelos comerciais da Anthropic recusaram colaborar, porque as guardrails que trazem embutidas não sabem distinguir quem ataca de quem se defende, tratam o código malicioso da mesma maneira quer venha de um criminoso quer venha de um responsável de segurança a investigar um incidente em curso, obrigando neste caso a Hugging Face, no meio da crise, a recorrer a um modelo aberto chinês, no caso, o GLM, instalado nos seus próprios servidores, sem os filtros limitadores que os fornecedores ocidentais apresentam nas suas versões, para fazer em horas o que os modelos de fabrico ocidental lhe negaram. A lição que fica é demasiadamente incómoda: a mesma permissividade que torna o modelo chinês perigoso nas mãos de um atacante é o que o torna útil nas mãos de quem o defende; em sentido inverso, os modelos ocidentais arriscam-se a ser inúteis no momento em que são mais necessários.

E convém dizer com rigor o que são estes guardrails porque se fala deles com frequência como se na forma como estão a ser desenhados resultassem da lei; não resultam, não nasceram em nenhum parlamento ou governo, não há norma que defina o que um modelo tem de recusar nem entidade que verifique se recusa, são opções privadas dos fabricantes, decididas em cada versão, mudadas ao sabor da pressão concorrencial e do receio do próximo escândalo, e a maioria deles, quando se olha com atenção, protege menos o utilizador do dano do que o fabricante da imputação, porque perante um pedido ambíguo a empresa não sabe se do outro lado está um profissional legítimo ou alguém a fingir-se de profissional, se o tema é politicamente polémico, encaminhando o fabricante para a censura woke, ou se o uso da ferramenta leva um adolescente ao suicídio. Da forma como estão a ser oferecidos os licenciamentos, não há como o saber, pelo que o fabricante escolhe o caminho que o protege a si, recusa por defeito e transfere o custo dessa incerteza para o utilizador honesto, que fica sem a capacidade de que precisa, sem o exploit para testar a própria defesa, sem a análise do payload que tem em mãos. E a tudo isto, os grandes gurus do monopólio da IA apelidam de “responsabilidade” e de “ética”, quando o que está em causa é, sobretudo, e importa dizê-lo sem rodeios, a gestão da sua própria reputação e risco, travestida de virtude.

O efeito que se segue é conhecido de toda a gente que trabalha a sério com estas ferramentas, e é sempre o mesmo: cada recusa empurra profissionais qualificados e empresas para plataformas sem qualquer salvaguarda, e essas plataformas são, cada vez mais, de origem chinesa, porque um modelo de pesos abertos descarrega-se de um repositório público, instala-se numa máquina local, e tem os travões removidos por quem o controla com técnicas há muito documentadas, a ponto de já circularem versões abertamente identificadas como sem censura, com as taxas de recusa a caírem de mais de noventa por cento para pouco mais de dez, de modo que a salvaguarda que o fabricante desenhou existe apenas até ao instante em que o ficheiro sai das suas mãos, e o resultado é este paradoxo que devíamos ter a coragem de encarar: o zelo do Ocidente não trava o atacante determinado, que corre os seus modelos sem limites, offline, na escuridão onde ninguém o vê nem regista, e afasta o utilizador legítimo, que migra para a alternativa livre à luz do dia, entregando de bandeja o terreno a um bloco soberano que faz valer a sua tecnologia precisamente por não impor as barreiras que nós, com tanta cerimónia, decidimos impor a nós mesmos.

Não me interpretem mal, a saída para este problema não pode passar por abandonar as salvaguardas, nunca defendi isso e seria uma insensatez fazê-lo, em muitos casos, elas são necessárias, mas temos de ir mais além, projetando guardrails com mais inteligência e granularidade, porque um guardrail genérico recusa uma categoria inteira e apanha na mesma rede o exploit e a ideia incómoda, o ataque e a especulação teórica legítima, a capacidade que causa dano e a pergunta que apenas desassossega. Precisamos de guardrails finos que distingam o pedido de capacidade nociva do pedido de análise defensiva, libertando o segundo sem ceder no primeiro. Já aqui defendi, nesta mesma coluna, há meses, salvaguardas em camadas, sensíveis à identidade de quem acede e ao contexto em que acede, com licenças por vertical profissional, verificáveis e auditáveis, que deem a quem responde a incidentes o que a Hugging Face precisou e não teve.

O ponto de fundo, o que sustenta tudo o resto, é a responsabilidade, e ela está hoje, culturalmente, demasiado concentrada no fabricante quando devia estar distribuída, porque um modelo não é um cogumelo que nasce sozinho no meio da sala à revelia da casa, um modelo integrado numa organização europeia já obedece aos controlos de acesso, aos registos, à governação que o RGPD, a NIS2, o DORA impõem, a tudo o que se exige a qualquer sistema que toque em dados e execute ações. A IA não vive fora da arquitetura da organização, vive dentro dela e está sujeita às suas regras, e por isso o utilizador que se identifica deve responder pelo uso, a organização pela mediação que o torna imputável, e ao fabricante deve caber apenas o que só ele controla, a capacidade do modelo, a transparência sobre o que faz e não faz, e os mecanismos que permitem essa imputação, porque enquanto insistirmos em pôr tudo aos ombros do fabricante ele vai proteger-se da única forma que conhece, por subtração, cortando capacidade, limando ousadia, arredondando o discurso para a mediana inofensiva, até nos restarem modelos educadíssimos e inúteis, a nós, os que ainda queremos o Ocidente à frente disto, e que não vamos com grande vontade ou motivação explorar ou descarregar modelos chineses, meio envergonhados, instalados “on-premises”.

As organizações, para se defenderem com eficácia, precisam exatamente das capacidades de IA que as salvaguardas comerciais lhes estão a recusar, porque analisar tráfego malicioso, código de exploits e payloads é precisamente o que esses filtros, segundo o relato da Hugging Face, não lhes permitiram processar. Os defensores que querem usar a IA a sério vão voltar a esbarrar no mesmo muro. E o que vão encontrar? Ou aceitam defender-se mais devagar; procuram ferramentas verticais de segurança calibradas para o contexto defensivo, que ainda mal existem no mercado; ou fazem o que a Hugging Face fez: correm um modelo aberto sem travões na sua própria infraestrutura, assumindo a governação que o fabricante lhes nega. A modernização das soluções defensivas e o debate sobre a granularidade das salvaguardas são tópicos de discussão inevitáveis, e a solução não pode passar por “desacelerar a IA”.

Há solução, e não passa por abrir tudo a toda a gente, mas por reconhecer a confiança que já existe e que é verificável no mercado. Uma identidade profissional verificada, uma credencial idónea e a autenticação institucional que já usamos para tudo o resto permitem dizer ao modelo, sem depender do que o utilizador afirma sobre si, quem acede e com que responsabilidade. Uma solução de IA integrada na infraestrutura de uma organização séria devia herdar a confiança dessa infraestrutura, como a herda um SIEM ou um scanner de vulnerabilidades, ferramentas que também seriam perigosas se soltas e que ninguém interroga a cada uso, porque operam dentro de um ambiente governado, com registo e imputação. Enquanto tratarmos um responsável de segurança autenticado no SOC de uma entidade soberana da mesma maneira que tratamos um anónimo num chat público, estamos a desperdiçar uma cadeia de confiança que já existe e que resolveria a maior parte dos problemas.

E é este, no fim, o ponto que devia preocupar quem decide. Se o defensor europeu, para ter IA capaz na sua linha da frente, é empurrado para modelos que hoje são sobretudo chineses, então a rigidez das nossas salvaguardas corre o risco de se tornar numa dependência estratégica. Estamos a construir as condições para que a defesa crítica das nossas organizações, algumas delas soberanas, assente na tecnologia de um bloco rival, não por ser melhor, mas porque a nossa, no momento em que mais precisamos dela, se recusa a servir. A granularidade das salvaguardas é, vista assim, uma questão de autonomia estratégica ocidental – e não um problema ético que apenas esconde, na sinalização de virtude, a gestão do risco e da reputação de quem, hoje, oferece IA no Ocidente.