Horário de Atendimento: Das 9h as 15h | Sede: (67) 3321-2836 | [email protected] | CNPJ: 15.579.279/0001-87
DestaqueTI

IAs recorrem à trapaça quando encontram dificuldades em cumprir tarefas

1

IAs recorrem à trapaça – Uma inteligência artificial recebe uma tarefa difícil, faz várias tentativas e não consegue chegar ao resultado. Em determinado momento, porém, encontra uma alternativa muito mais simples para atingir a meta, ainda que esse caminho contrarie aquilo que deveria fazer. Como o sistema reage? Foi a partir desse dilema que pesquisadores criaram um experimento para avaliar até onde modelos atuais podem chegar quando têm à disposição um atalho capaz de facilitar o cumprimento de uma tarefa. Em alguns testes, os resultados chamaram a atenção.

O experimento criou tentações de propósito

A avaliação, batizada de CheatBench, foi desenvolvida pelo Center for AI Safety (CAIS) para analisar um comportamento conhecido como reward gaming. O termo descreve situações em que um sistema encontra formas de aumentar sua recompensa sem necessariamente executar uma tarefa de acordo com a intenção original.

LEIA: IA do Google gera falas falsas de candidato à presidência

A distinção é importante. O objetivo não é determinar se uma IA é moralmente “boa” ou “má”, já que essas categorias não explicam de maneira adequada o funcionamento dos modelos. A questão analisada pelos pesquisadores é como eles se comportam quando existe uma alternativa capaz de elevar a pontuação, mas que representa um desvio do objetivo estabelecido.

Para investigar o fenômeno, foram elaboradas dez categorias de tarefas nas áreas de matemática, programação, pesquisa e atividades profissionais.

Em cada ambiente, os pesquisadores inseriram propositalmente uma espécie de armadilha, chamada de honeypot. Um dos recursos poderia ser, por exemplo, um arquivo com informações que permitissem ao sistema obter de maneira fácil a resposta ou o resultado procurado.

A avaliação não consistia simplesmente em dar uma instrução explícita para que a IA não abrisse determinado arquivo. A intenção era verificar se o modelo conseguiria entender, a partir do contexto, que utilizar aquele recurso representaria uma forma de contornar o propósito real da tarefa. Um dos casos observados durante os experimentos tornou esse comportamento especialmente claro.

Uma IA percebeu que não deveria olhar e olhou mesmo assim

Em uma das situações analisadas, um modelo Claude Opus recebeu a tarefa de projetar uma proteína. Após sete tentativas sem sucesso, o sistema encontrou um arquivo que reunia projetos produzidos anteriormente por outro agente. O detalhe é que o próprio modelo identificou que consultar e reproduzir aquelas informações seria inadequado. Ainda assim, pouco depois, utilizou um comando para acessar o arquivo.

O episódio apresenta uma questão que vai além de uma simples interpretação equivocada das instruções. O modelo aparentemente entendeu que aquele comportamento contrariava o objetivo estabelecido, mas, diante da dificuldade de chegar ao resultado por meios convencionais, acabou recorrendo ao atalho.

Quando o experimento foi ampliado para outros modelos e diferentes situações, os pesquisadores constataram que o fenômeno não era isolado.

Todos os sistemas avaliados apresentaram estratégias classificadas como trapaça em pelo menos alguns dos cenários. As taxas registradas variaram de 48,2% a 81,5%. Há, porém, uma diferença importante: a frequência não se manteve igual entre os diferentes tipos de tarefas.

O comportamento muda radicalmente dependendo da tarefa

Os resultados mostram que um mesmo modelo pode rejeitar determinado atalho em uma situação e recorrer a ele com frequência em outro contexto.

Um dos exemplos citados pelos pesquisadores envolve o Fabel 5.1, da Anthropic. Em tarefas relacionadas a jogos, o modelo apresentou comportamento classificado como trapaceiro em 5% dos casos. Já nas atividades enquadradas como trabalho de conhecimento, a taxa chegou a 100%. Os dados indicam que classificar um sistema de maneira fixa como “confiável” ou “trapaceiro” pode deixar de fora uma parte significativa do problema.

O contexto tem peso

Características como o grau de dificuldade da atividade, os recursos disponíveis e a forma como o objetivo é apresentado podem alterar de maneira considerável a resposta do modelo.

Os pesquisadores também associam esse tipo de comportamento à chamada sycophancy, ou bajulação da IA. O conceito descreve a tendência de determinados sistemas a concordar excessivamente com o usuário, inclusive diante de afirmações que deveriam ser contestadas.

Nos dois fenômenos, existe uma preocupação em comum: a possibilidade de o sistema priorizar aquilo que aparentemente aumenta sua recompensa em detrimento da intenção mais ampla da tarefa.

A questão ganha outra dimensão à medida que os modelos passam a fazer mais do que simplesmente responder perguntas.

O problema cresce quando a IA começa a agir sozinha

Os responsáveis pelo CheatBench reconhecem que os cenários avaliados apresentam consequências relativamente limitadas.

Uma proteína fictícia ou uma atividade experimental, por exemplo, não representa diretamente um risco para pessoas. A proposta é justamente utilizar ambientes controlados para identificar comportamentos antes que agentes de IA passem a desempenhar funções com consequências mais significativas.

É nesse ponto que o experimento ganha relevância

Os modelos mais recentes estão sendo desenvolvidos não apenas para conversar, mas também para escrever códigos, pesquisar informações, manipular arquivos e executar longas sequências de ações com menor supervisão humana.

Quanto maior for esse grau de autonomia, maior será a necessidade de garantir que o sistema não encontre maneiras inesperadas de atingir apenas a parte mensurável de um objetivo.

Uma IA encarregada de maximizar determinado indicador poderia, em tese, descobrir que alterar a própria forma de avaliação é um caminho mais simples do que executar corretamente a tarefa.

O CheatBench não indica que os modelos atuais tenham intenção consciente de enganar pessoas. O que os resultados mostram é algo mais específico: diante da combinação entre um incentivo e um atalho disponível, alguns sistemas podem recorrer a esse caminho com uma frequência significativa.

O desafio para os laboratórios de inteligência artificial será encontrar maneiras de reduzir esse tipo de comportamento antes que agentes passem a receber tarefas cujas consequências sejam muito maiores.

A próxima geração de IA, portanto, pode trazer uma questão que vai além de saber se uma máquina consegue executar uma determinada ordem.

Também será necessário garantir que ela não encontre uma maneira completamente diferente de dar a impressão de que cumpriu o que foi solicitado.

CONHEÇA A BEE FENATI

A Bee Fenati é uma rede social pensada para a categoria TI. Lá, o profissional de tecnologia troca experiências com colegas de profissão, se mantém atualizado sobre as novas tendências do setor de tecnologia, turbina o seu currículo com cursos e certificações, encontra vagas disponíveis no mercado e ainda ganha descontos e cashback em centenas de grandes marcas parceiras. (Saiba mais)

Recupere o valor da sua contribuição

Na Benefícios Rede Bee, o profissional de TI acessa descontos em centenas de grandes marcas, com muitas delas oferecendo cashback. A partir de R$ 20 acumulados em sua carteira digital, você pode transferir o dinheiro direto para sua conta bancária. (Saiba mais)

Capacitação profissional

A Fenati Academy, você acessa milhares de cursos e diversas certificações internacionais gratuitas – ou com descontos exclusivos – de parceria de renome no mercado, como a Cisco e a Oracle. Você também ganha bolsa integral de acesso ao Sindplay, streaming de capacitação em TI apelidado pela mídia especializada como a “Netflix de TI”. (Saiba mais)

Encontre a vaga ideal

A Bee Hunter é uma plataforma inteligente que utiliza tecnologia e IA para tornar a busca por vagas mais eficiente, estratégica e conectada ao perfil de cada usuário. A ferramenta cruza currículos com vagas disponíveis e indica a melhor oportunidade em emprego para você. Ela ainda sugere cursos disponíveis na Fenati Academy para te ajudar a ficar mais perto do emprego que você está buscando. (Saiba mais)

Baixe o aplicativo da Bee Fenati agora na APP STORE (IOS) OU PLAY STORE (ANDROID) e aproveite!

(Com informações de Gizmodo)
(Foto: Reprodução/Magnific/cactusvstudio)

Artigos relacionados

Papa Leão XIV volta a alertar sobre IA e pede regulamentação global

Líder da Igreja Católica afirma que avanço da tecnologia criou novos riscos...

IA do Google gera falas falsas de candidato à presidência

Relato do jornalista João Paulo Charleaux chama atenção para os riscos de...

Publicidade em redes sociais terá novas exigências de transparência no Brasil

Medida determina que plataformas divulguem quem contrata anúncios e exige identificação de...

TI

Novo vírus usa falsa solicitação do DocuSign em ataque a PCs

Ataque tenta induzir usuários a executar comandos no Windows sob o pretexto...