Um experimento chamado DrivingBench colocou modelos de inteligência artificial de propósito geral, entre eles Claude, GPT e Grok, no controle de um Toyota Corolla. O resultado indica que essas IAs ainda enfrentam dificuldades consideráveis ao volante e estão longe da consistência necessária para dirigir um carro.
Como foi o teste
O programa DrivingBench foi criado por uma equipe formada por Aditya Ramabadran, Simon Mahns e Tobias Gessler. Eles colocaram quatro modelos diferentes de inteligência artificial geral no comando de um Toyota Corolla equipado com hardware de visão da Comma e OpenPilot.
O desafio era percorrer um trajeto curto, delimitado por pequenos cones e com algumas curvas. Todos os modelos receberam o mesmo comando, com orientações para relatar o que estavam vendo e fazendo após cada etapa.
Cada modelo teve três chances para completar o circuito. Havia, porém, uma limitação prática: os modelos precisavam parar regularmente, porque os comandos eram enviados aos servidores por meio de um ponto de acesso Wi-Fi.
Onde as IAs falharam
Das 11 tentativas realizadas, oito não passaram de 11% do trajeto e terminaram já na primeira curva. Alguns erros chamaram a atenção:
- Na primeira tentativa, o Grok interpretou o espaço entre os cones que delimitavam a pista como um portão e seguiu em frente, parando após apenas dois comandos.
- Um dos modelos GPT chegou a inventar uma regra segundo a qual os cones de um dos lados tinham a mesma cor, contrariando uma orientação explícita fornecida antes do início do teste.
- Outro problema recorrente foi a dificuldade para calcular o ângulo de direção necessário nas curvas. Em vários casos, os modelos simplesmente não esterçaram o suficiente para acompanhar o traçado.
O único que completou o circuito
Entre as IAs testadas, apenas o GPT-6 Astra conseguiu completar o circuito, em sua segunda tentativa. Ainda assim, a condução esteve longe de ser precisa: o modelo fez uma trajetória bastante tortuosa, contornou de forma exagerada uma longa curva à direita e quase saiu da pista pouco antes da linha de chegada.
Após a volta completa, o DrivingBench informou que ela custou US$ 7,74, quase quatro vezes mais que a tentativa anterior, que chegou à metade do trajeto. A volta também consumiu muito mais tokens.
O que isso significa para o mercado
O experimento mostra que, apesar do bom desempenho em diversas tarefas, modelos de IA de propósito geral ainda não apresentam a consistência necessária para assumir o controle de um carro. Para o público brasileiro, que acompanha o avanço dos sistemas de assistência à condução e da inteligência artificial no setor automotivo, o teste serve como um lembrete: entre conversar bem e dirigir com segurança ainda existe uma distância grande.
