Uma equipe composta pelos agentes Aditya Ramabadran, Simon Mahns e Tobias Gessler criaram o programa DrivingBench, que colocou quatro modelos de inteligência artificial geral diferentes no controle de um Toyota Corolla equipado com hardware de visão da Comma e OpenPilot. Entre os programas escolhidos estavam o Claude, GPT e o Grok.
NÃO FIQUE DE FORA do que acontece de mais importante no mundo sobre rodas!
O teste consistia em percorrer um trajeto curto, delimitado por pequenos cones e com algumas curvas. Todos receberam o mesmo comando, com orientações para relatar o que estavam vendo e fazendo após cada etapa. Os modelos tiveram três chances para completar o circuito, mas precisavam parar regularmente porque os comandos eram enviados aos servidores por meio de um ponto de acesso Wi-Fi.

Após a apuração dos resultados, foi comprovado que os modelos ainda encontram dificuldades consideráveis ao volante. Das 11 tentativas realizadas, oito não passaram de 11% do trajeto e terminaram já na primeira curva.
Na primeira tentativa, o Grok interpretou o espaço entre os cones que delimitavam a pista como um portão e seguiu em frente, parando após apenas dois comandos. Um dos modelos GPT chegou a inventar uma regra segundo a qual os cones de um dos lados tinham a mesma cor, contrariando uma orientação explícita fornecida antes do início do teste.
Outro problema recorrente foi a dificuldade para calcular o ângulo de direção necessário nas curvas. Em vários casos, os modelos simplesmente não esterçaram o suficiente para acompanhar o traçado.
Dentre as IAs utilizadas, apenas o GPT-6 Astra conseguiu completar o circuito em sua segunda tentativa. Ainda assim, a condução esteve longe de ser precisa: o modelo fez uma trajetória bastante tortuosa, contornou de forma exagerada uma longa curva à direita e quase saiu da pista pouco antes da linha de chegada.
Após a volta completa, o DrivingBench informou que a volta custou US$ 7,74, quase quatro vezes mais que a tentativa anterior, que chegou à metade do trajeto, além de consumir muito mais tokens.
O experimento mostra que, apesar do desempenho em diversas tarefas, modelos de IA de propósito geral ainda estão longe de apresentar a consistência necessária para assumir o controle de um carro.
Newsletter
Receba diretamente em seu e-mail notícias, dicas e conteúdos exclusivos que foram destaque no AutoPapo
👍 Curtiu? Apoie nosso trabalho seguindo nossas redes sociais e tenha acesso a conteúdos exclusivos. Não esqueça de comentar e compartilhar.
Ah, e se você é fã dos áudios do Boris, acompanhe o AutoPapo no YouTube Podcasts: