Saltar al contenido
jueves 8 de octubre de 2026
🌧️21°CGOBERNADOR VIRASORO · LluviaMáx 26° · Mín 19°Clima: MET Norway

Pusieron a GPT, Claude y Grok al volante de un Toyota Corolla. Solo uno superó la prueba

Tres ingenieros pusieron modelos de OpenAI, Anthropic y SpaceXAI al mando de un auto de verdad. ¿Qué modelo de IA manejó mejor?

Fuente Wired 7 min de lectura
CompartirFacebookXTelegram

Aditya Ramabadran, Simon Mahns y Tobias Gessler, tres ingenieros de IA de una startup llamada Axiom, tuvieron hace poco ganas de comer en In-N-Out Burger. Sin embargo, no tenían intención de conducir ellos mismos.

Sentados en un Toyota Corolla de 2024 cerca del drive-thru del restaurante de la zona de la Bahía, abrieron una laptop y le pidieron a GPT-6 Astra, de OpenAI, que se pusiera al volante. Conectaron una interfaz de chat a un servidor, que a su vez estaba conectado a varias cámaras montadas en el parabrisas y al sistema de dirección asistida del auto. Un conductor de seguridad mantuvo un pie sobre el freno, por si acaso.

El modelo de IA, que normalmente se encarga de generar texto, código y alguna que otra imagen, condujo el vehículo de forma lenta pero segura hasta la ventanilla para que pudieran recoger su comida.

"Quizá la inteligencia artificial general (IAG) ya esté aquí, después de todo", comentó uno de los ingenieros, refiriéndose a la idea tan popular de máquinas capaces de igualar la inteligencia humana.

Los vehículos autónomos no son nada nuevo, pero normalmente los controlan algoritmos entrenados y diseñados específicamente para esa tarea. En este caso, la operación partió de un modelo diseñado para generar texto, y se llevó a cabo sobre la marcha, sin ningún tipo de entrenamiento previo por parte del trío. Esta hazaña en el restaurante de comida rápida, así como otros experimentos, sugieren que los modelos de IA basados en el lenguaje están empezando a adquirir una comprensión rudimentaria, pero útil, del mundo físico.

Aunque durante el paseo del trío no ocurrió nada especialmente alarmante, admiten que poner un modelo de propósito general al mando de un bloque de acero de dos toneladas que se mueve a gran velocidad es una tarea de alto riesgo. A medida que mejore nuestra comprensión de la física, podríamos ver cómo los modelos de IA se integran en el mundo real de maneras nuevas, impresionantes y quizás peligrosas.

Ese robotaxi sin conductor podría estar espiándote

Los vehículos autónomos de Waymo, Zoox y Tesla están repletos de cámaras y sensores. Algunos de ellos están orientados hacia los pasajeros.

La dimensión física

Los modelos más inteligentes de hoy en día son muy buenos respondiendo a preguntas complejas e incluso realizando algunas tareas virtuales de forma autónoma, pero sus habilidades tienden a limitarse al mundo de las computadoras conectadas a internet. Si llevamos estos modelos al mundo real, enseguida se quedan desconcertados. A pesar de las afirmaciones de que la IAG ya está aquí, las empresas de IA ven claramente el razonamiento físico como una frontera aún por conquistar.

Algunos investigadores han dejado las grandes empresas para fundar startups centradas en resolver el razonamiento físico. Andrew Dai, CEOa de una de estas empresas, llamada Elorian AI, trabajó anteriormente como investigador en Google DeepMind. Afirma que un mejor razonamiento visual abrirá las puertas a muchas nuevas aplicaciones para la IA, como sistemas que entiendan si los comensales están disfrutando de su comida en un restaurante o robots capaces de funcionar en un hogar. Dai afirma que la robótica es un caso de prueba crucial para las habilidades de razonamiento físico: "Es esencial, no se puede imaginar la robótica doméstica sin esto".

Elorian y Scale AI, una empresa que proporciona datos de entrenamiento a los grandes laboratorios de IA, han desarrollado un nuevo punto de referencia, "Humanity’s Sixth Sense", que mide la capacidad de los modelos para comprender escenas físicas.

"La mayor parte de la investigación en IA visual se centra en la percepción. Queríamos preguntarnos qué se necesitaría realmente para que un modelo comprendiera una escena de forma intuitiva, tal y como lo hace una persona sin pensarlo", explica Xingang Guo, investigador científico de Scale AI que participó en el desarrollo del punto de referencia.

Para Ramabadran, Mahns y Gessler, el objetivo de su proyecto, llevado a cabo al margen de su trabajo en Axiom, era medir la eficacia con la que los modelos pueden desenvolverse en el mundo real.

Se les ocurrió la idea de poner a prueba las habilidades de conducción de los modelos mientras pasaban el rato juntos un fin de semana. Se dieron cuenta de que modelos como Astra eran capaces de crear simulaciones 3D complejas y se preguntaron si eso podría traducirse en la capacidad de desenvolverse en el mundo real.

"Todos vivimos en el Área de la Bahía y estamos acostumbrados a ver Teslas y Waymos, así que quizá eso influyó", me cuenta Ramabadran.

Los ingenieros probaron primero el modelo Grok de SpaceXAI antes de experimentar con los últimos modelos de OpenAI y Anthropic. Al principio, los modelos se negaron a tomar el control de los vehículos; respondían con frases del tipo: "Puedo ayudar a interpretar imágenes de la carretera, pero no puedo dar órdenes de movimiento a un auto físico". Pero con unas indicaciones cuidadosas, se les pudo convencer para que fueran más allá. Los tres se quedaron atónitos cuando los modelos empezaron a conducir.

Patas al volante: el increíble experimento que enseñó a las ratas a conducir

Manejar representó una forma interesante para los neurocientíficos de estudiar cómo los roedores adquieren nuevas habilidades. Inesperadamente, las ratas tenían una intensa motivación por sus clases de manejo.

Enseñar a Claude, GPT y Grok a manejar

Los ingenieros afirman que las grandes empresas de IA parecen centrarse en mejorar las capacidades de razonamiento espacial de sus últimos modelos, pero dudan de que esto signifique que realmente los estén entrenando para conducir autos. Según ellos, es probable que las habilidades de conducción de los modelos se hayan materializado como parte de un entrenamiento centrado en el razonamiento 3D. "Esto podría ser como una capacidad emergente derivada simplemente de ampliar la multimodalidad del modelo", me explica Mahns, refiriéndose a datos de entrada como imágenes, videos y modelos 3D que ahora se utilizan para entrenar los modelos.

Aun así, una nueva prueba de referencia sobre conducción del trío, llamada DrivingBench, sugiere que estos modelos aún tienen un largo camino por recorrer antes de poder aprobar un examen de conducir. La prueba mide la capacidad de un modelo para recorrer un circuito sencillo, simulado en un estacionamiento. Solo Astra es capaz de completar el recorrido, y además muy lentamente. Claude Fable 5.1 recorrió el 45% del trayecto, y Grok solo el 11%.

Ramabadran afirma que los últimos modelos parecen capaces de adaptarse a los errores; al parecer, se adaptaron a los controles del auto y mejoraron su conducción en tiempo real: "Los modelos realmente parecían estar ajustándose o aprendiendo en contexto a partir de sus errores y aprendiendo a manejar mejor los mandos".

Artículo originalmente publicado en WIRED.com. Adaptado por Alondra Flores.

CompartirFacebookXTelegram