Anthropic посадит оценщиков Accenture внутрь компании

Оценивать модели Anthropic будет чужая команда, но рабочие места у неё будут внутри самой Anthropic. Компания объявила в X, что договорилась с Accenture о независимой оценке передового ИИ, и обе стороны рассчитывают вложить в это направление не менее миллиарда долларов за ближайшие пять лет.
Коротко
- Anthropic позвала Accenture в качестве независимого оценщика своих передовых моделей, и в Anthropic называют это частью недавнего обещания разместить оценщиков у себя внутри.
- Деньги названы одной цифрой: не менее миллиарда долларов за пять лет, причём в анонсе эта сумма отнесена сразу к обеим компаниям без разбивки по сторонам.
- По данным unite.ai, в работу войдут оценка и ред-тиминг моделей, проверки на согласованность и тесты защитных механизмов; численность команды и сроки старта в анонсе не названы.
Если вы не следили, внешняя проверка моделей обычно устроена как разовый заход. Лаборатория даёт сторонней команде доступ к модели перед релизом, та ищет слабые места и отдаёт отчёт. Anthropic недавно пообещала другой формат, с оценщиками на месте, и сделка с Accenture идёт в счёт этого обещания.
Сам анонс умещается в пару строк. Anthropic и Accenture договорились о независимой оценке передового ИИ, и обе компании рассчитывают за ближайшие пять лет вложить в наращивание такой работы не меньше миллиарда долларов. Других цифр в объявлении нет: ни сроков, ни размера команд, ни того, как расходы делятся по годам.
Что именно будут делать оценщики, подробнее описывает unite.ai: оценка и ред-тиминг моделей, проверки на согласованность и тесты защитных механизмов. Ред-тиминг означает, что команда сама атакует модель и ищет, где она ломается. Проверка на согласованность смотрит, ведёт ли модель себя так, как заявлено, а тесты защиты проверяют, держатся ли ограничители под нагрузкой.
Ключевое слово во всей истории всё-таки «внутри». Разница между приглашённой проверкой и встроенной примерно такая же, как между приёмкой на выходе с завода и контролёром, который сидит в цеху весь цикл. Обещание Anthropic про embedded evaluators как раз про это: оценщик не приезжает на неделю перед релизом, а работает на месте постоянно.
Из формулировки анонса не разобрать, миллиард это общий счёт на двоих или столько с каждой стороны, и, на наш взгляд, для суммы такого масштаба разбивка напрашивалась сама собой. Не объяснено и то, как устроена независимость оценки, когда проверяющие сидят внутри проверяемой компании и работают по коммерческому договору.
Когда сядут первые оценщики
Горизонт объявлен пятилетний, а точек внутри него нет: дату, с которой команда Accenture приступает, Anthropic не назвала, графика найма тоже нет. Открытый вопрос в том, всплывут ли результаты этой работы в публичных материалах Anthropic о безопасности моделей или останутся внутренними. Пока из проверяемого есть только сумма и срок.
Читайте также
- Под вывеской студии дизайна ПО скрывался реселлер Claude
- Kimi K3 обучена на Claude незаконно, заявляет Anthropic
- Anthropic заплатит Akamai минимум 11,6 млрд долларов
- Anthropic снова берёт деньги за заблокированные запросы
- Союзники Трампа делают Амодеи лицом «ИИ-думеризма»
- Продавцы Amazon смогут вести магазин прямо в Claude
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
