21 сентября проект DrivingBench опубликовал результаты теста, в котором четыре передовых коммерческих модели общего назначения — GPT-6 Astra, Claude Fable 5.1, Grok 4.6 и GPT-5.6 Sol — управляли реальным автомобилем на коротком маршруте и должны были проехать по трассе с несколькими поворотами. По итогам соревнования единственным, кто справился с задачей, оказалась Astra от OpenAI, причем на втором подходе. Эта победа привлекла внимание к теме того, может ли фронтирная модель общего назначения реально участвовать в автономном вождении. Источник данных — блок 0.

Исследование проводилось независимой командой инженеров и исследователей в области искусственного интеллекта: Саймон Манс, Адитья Рамабадран и Тобиас Гесслер. Для связи «модель–машина» использовали Toyota Corolla, оборудованную устройством comma four для систем полуавтономного управления, которое служило мостом между машиной и программной системой на базе моделей. Трасса имела длину примерно 130 метров и искривленную форму с тремя плавными поворотами. Авторы также проложили маршрут по одной из парковок, чтобы проверить, как ИИ-агенты работают на практике. Источник данных — блок 2.

Для обеспечения безопасности скорость на тестовой площадке была ограничена до 12,6 км/ч, а за рулем сидел инженер, готовый перехватить управление в любой момент. Каждую модель исследователи могли запустить до трёх попыток; для шкалы лидеров учитывали лучший результат. В целом было зафиксировано 11 заездов (из-за пропуска одного), где Astra прошла трассу со второй попытки — 5 минут 22 секунды, пройдя 134,7 метра и не задев ни одного конуса. Эти данные позволили сравнить результаты между моделями: остальные участники достигали заметно меньших дистанций и часто сталкивались с первым поворотом. Источник данных — блок 5.

Такой подход отличается от стандартных заданий автономного вождения: авторы DrivingBench прямо сформулировали задачу как проверку способности фронтирных моделей общего назначения на базе LLM справляться с вождением в реальных условиях. Традиционные автономные системы часто состоят из нескольких слоёв датчиков и модулей — восприятия, предсказания поведения участников движения, планирования траекторий и контроля. В испытании же ставилась задача понять, может ли мультимодальная LLM-инициатива руководить автомобилем через агентную обвязку и последовательности кадров без строения специализированной инфраструктуры. Источник данных — блоки 10, 16, 17.

Несмотря на интерес к эксперименту, авторы констатируют ограниченность результатов: успешная Astra демонстрирует возможность, но в рамках стерильных условий проекта — пустой парковки, низкой скорости и заранее заготовленных сценариев. В 2026 году такие примеры не являются шокирующими, однако они показывают, что нейросетевые агентные подходы могут выйти за пределы чистой теории и начать работать в физическом мире на ограниченных задачах. При этом отмечается, что поток вычислений и доступ к огромным дата-центрам остаются препятствием на пути к широкому применению. Источник данных — блоки 8, 20, 21, 22.