OpenAI тренирует агентов на договорной рутине Ironclad

В блоге OpenAI выложены два ролика с одной и той же задачей в договорной системе Ironclad: GPT-6 Astra выполнила около 94% критериев примерно за 20 расчётных минут, а GPT-5.6 Sol около 85% за 32 минуты. За роликами стоит первое партнёрство OpenAI с производителем специализированного софта, чьи рабочие задачи превращают в материал для обучения и оценки моделей.
Коротко
- GPT-6 Astra стала первой фронтир-моделью OpenAI, обученной на задачах Ironclad: 11 сценариев из юридической, коммерческой и закупочной работы, на каждый из которых опытный пользователь тратит в среднем 30–40 минут.
- На всех 11 задачах Astra в режиме Max reasoning набрала в среднем 55,0%, GPT-5.6 Sol в режиме High reasoning 41,6%, а расчётное время попытки сократилось с 37,0 до 19,2 минуты.
- Оценку проводила сама OpenAI, задач всего 11, а время в ней расчётное; даже Astra выполняет в среднем 55,0% требований, и OpenAI сама пишет, что человеческий контроль по-прежнему нужен.
Если вы не следили: на запуске GPT-6 Astra OpenAI показывала, как модель работает за компьютером с профессиональными задачами, от подготовки документов до тестирования сайтов. Следующей целью компания называет специализированный софт для бизнеса, где модель должна понимать правила конкретной компании, проходить многошаговые процессы и проверять, что результат соответствует исходным требованиям. Для этого OpenAI начала работать напрямую с небольшим числом софтверных компаний, и Ironclad оказалась первой из них.
В лучших режимах Astra набирает 55,0% на 11 задачах Ironclad против 41,6% у GPT-5.6 Sol
Каждую модель OpenAI сравнивала в той настройке, где та показала лучший результат: Astra в режиме Max reasoning, GPT-5.6 Sol в режиме High reasoning. На 11 исследовательских задачах средний балл Astra с Max reasoning составил 55,0%, у Sol с High reasoning 41,6%, то есть на 32% выше. Расчётное среднее время одной попытки в тех же режимах сократилось с 37,0 минуты у Sol до 19,2 минуты у Astra, на 48%.
Иначе говоря, Astra выполнила больше требований задач и потратила на попытку меньше симулированного времени. Балл показывает, какую долю критериев задачи модель выполнила. Есть и результат выше: внутренняя модель, которую OpenAI использовала при разработке Astra, набрала на тех же задачах 63,7%. Компания хочет перенести этот прирост в будущие модели.
Одиннадцать задач, на которые у опытного пользователя уходит 30–40 минут
Типичный пример OpenAI выглядит так. Отдел юридических операций настраивает процесс закупки софта: финансы согласуют покупки дороже определённой суммы, служба безопасности смотрит отдельные запросы, юристы проверяют нестандартные условия. Из этого короткого списка нужно собрать форму заявки, шаблоны документов, правила согласования и запись итогового договора.
Задачи отбирали сотрудники Ironclad вместе с теми, кто пользуется Ironclad внутри OpenAI. В набор вошли настройка соглашений о неразглашении, процессы согласования закупок и правка типового юридического пункта, чтобы он учитывал выбранную заявителем юрисдикцию. По оценке OpenAI, опытный пользователь в среднем тратит на одну задачу 30–40 минут.
Каждую задачу проверяли по списку из 8–50 критериев, в зависимости от сложности, а что считать успехом, по словам OpenAI, помогала определить экспертиза Ironclad. По такой разметке видно, какие шаги модель сделала верно, а на каких сорвалась.
OpenAI зовёт других производителей софта прийти с примером, где агент ошибается
В части про Ironclad OpenAI пишет, что договорный процесс должен обрабатывать исключения и при этом сохранять правила, на которые опирается бизнес. Если агент теряет одно из таких правил посреди задачи, софтверная компания не может уверенно поручать ему работу. Поэтому, по формулировке источника, человеческий контроль и полноценная договорная платформа остаются необходимыми.
Ironclad, по тексту OpenAI, получает возможность приносить свои проблемы в разработку базовой модели и в перспективе использовать более сильные модели в собственных продуктах. Для юридических и бизнес-команд ИИ, возможно, возьмёт на себя больше работы со сложными договорами, а привычные механизмы контроля сохранятся.
Другие компании OpenAI просит прийти с конкретным примером: что должен сделать агент, где именно он ошибается и как оценивать успех. От партнёра также ждут людей, глубоко знающих эту работу, защищённую среду для тестов и данные, которые можно безопасно использовать в исследованиях.
Модель тренировалась в размещённых копиях Ironclad с подкреплением
Правильно выполнить отдельные шаги здесь мало, работать должен весь процесс. Например, агент настраивает согласование финансами для сумм выше порога, а потом проверяет, что заявки выше и ниже порога действительно идут разными маршрутами.
Для тренировки Ironclad предоставила размещённые программные окружения своего продукта. Исследователи OpenAI построили вокруг типичных процессов синтетические обучающие задачи и применили обучение с подкреплением: модель выполняет задачу, получает обратную связь и пробует снова. Примерно так учится стажёр в песочнице, где ошибка не ломает настоящие договоры.
В OpenAI объясняют, что подход держится на трёх вещах: задачи выбраны вместе с людьми, которые знают эту работу, есть подробные критерии и есть место для практики. По словам компании, так улучшения приходятся на реальные задачи, важные для клиентов.
Подвох в масштабе и в том, кто ведёт подсчёт. Задач всего 11, оценка исследовательская и внутренняя, её проводила сама OpenAI, а время попытки расчётное, и как его считали, в доступном тексте не объясняется. На наш взгляд, показательнее всего абсолютная цифра: даже Astra в своём лучшем режиме выполняет в среднем 55,0% требований, так что юристам по-прежнему есть что проверять за агентом.
Когда 63,7% дойдут до будущих моделей
OpenAI хочет перенести результат внутренней модели в будущие модели, но не называет ни сроков, ни имени этой модели. Неизвестно и то, кто станет следующим партнёром после Ironclad: пока компания только приглашает небольшое число софтверных фирм с задачами, которые нынешние агенты не решают надёжно. Открытым остаётся и вопрос, проверит ли кто-нибудь эти замеры независимо.
Читайте также
- Astra заявлена лучшей в тестах работы за компьютером
- Надзиратель за агентом в ChatGPT стал бесплатным
- Агент OpenClaw читал память и после её отключения
- Wikimedia нашла следы агентов OpenAI в своих вики
- Сутки проверки агентов OpenAI стоят больше 500 000 долларов
- OpenAI предупредила о своих агентах более 100 организаций
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
