Больше не нужно искать — необходимые
обучающие материалы и подсказки всегда под рукой

В техническом эксперименте Nvidia точность модели Cosmos 3 Nano в тесте с выбором правильного ответа из четырёх вариантов выросла с 54,41% до 93,35% менее чем за сутки. Основные этапы дообучения выполнил ИИ-агент Codex по заранее заготовленным инструкциям с использованием инструментария TAO.
Результат был получен на специализированном наборе данных Woven Traffic Safety от компании Woven by Toyota. В датасет входят видеозаписи дорожных ситуаций и вопросы с четырьмя вариантами ответов. Для обучения и проверки использовалось более 8000 примеров.
Без дополнительной настройки Cosmos 3 Nano давала правильные ответы в 54,41% случаев. Затем разработчики поручили Codex оценить базовую модель и провести дообучение методом LoRA.
Агент выбрал подходящую инструкцию Cosmos-reason, проверил аннотации датасета и обнаружил, что отсутствует параметр частоты кадров. После исправления конфигурации он загрузил веса модели, подготовил настройки и запустил обучающий контейнер.
Метод LoRA не изменяет все параметры модели, а обучает небольшие дополнительные адаптеры. По расчётам Nvidia, в этом эксперименте метод потребовал примерно в семь раз меньше GPU-часов, чем полное дообучение Cosmos 3 Nano.
Один прогон LoRA занял около 30 минут на восьми ускорителях NVIDIA A100 с 80 ГБ памяти. Точность выросла до 87,14%.
Вторым промптом разработчики запустили TAO AutoML для подбора скорости обучения, размера пакета, параметров LoRA и других настроек. Система провела 43 параллельных испытания. Лучший результат с байесовской оптимизацией составил 93,35%. Этот этап занял 19,5 часа на нескольких узлах A100 в Oracle Cloud Infrastructure.
В ходе эксперимента Codex не ограничивался анализом результатов. Он выбирал рабочий процесс, проверял данные, исправлял конфигурацию, запускал контейнеры и сравнивал метрики. Автономность агента оставалась ограниченной — он действовал по заранее подготовленным инструкциям.
Показатель 93,35% отражает точность ответов в проверочной части одного исследовательского датасета. Он не измеряет безопасность автономного вождения и не подтверждает способность модели принимать решения в реальном времени.
Напомним, в июне исследователи Nvidia, Carnegie Mellon University и Калифорнийского университета в Беркли представили фреймворк ENPIRE, который позволяет ИИ-агентам для программирования улучшать политики управления роботами на реальном оборудовании
Популярные новости: