Перейти к содержанию

anthropic

Anthropic посадит оценщиков Accenture внутрь компании

Claude News

Оценивать модели Anthropic будет чужая команда, но рабочие места у неё будут внутри самой Anthropic. Компания объявила в X, что договорилась с Accenture о независимой оценке передового ИИ, и обе стороны рассчитывают вложить в это направление не менее миллиарда долларов за ближайшие пять лет.

Коротко

  • Anthropic позвала Accenture в качестве независимого оценщика своих передовых моделей, и в Anthropic называют это частью недавнего обещания разместить оценщиков у себя внутри.
  • Деньги названы одной цифрой: не менее миллиарда долларов за пять лет, причём в анонсе эта сумма отнесена сразу к обеим компаниям без разбивки по сторонам.
  • По данным unite.ai, в работу войдут оценка и ред-тиминг моделей, проверки на согласованность и тесты защитных механизмов; численность команды и сроки старта в анонсе не названы.

Если вы не следили, внешняя проверка моделей обычно устроена как разовый заход. Лаборатория даёт сторонней команде доступ к модели перед релизом, та ищет слабые места и отдаёт отчёт. Anthropic недавно пообещала другой формат, с оценщиками на месте, и сделка с Accenture идёт в счёт этого обещания.

Сам анонс умещается в пару строк. Anthropic и Accenture договорились о независимой оценке передового ИИ, и обе компании рассчитывают за ближайшие пять лет вложить в наращивание такой работы не меньше миллиарда долларов. Других цифр в объявлении нет: ни сроков, ни размера команд, ни того, как расходы делятся по годам.

Что именно будут делать оценщики, подробнее описывает unite.ai: оценка и ред-тиминг моделей, проверки на согласованность и тесты защитных механизмов. Ред-тиминг означает, что команда сама атакует модель и ищет, где она ломается. Проверка на согласованность смотрит, ведёт ли модель себя так, как заявлено, а тесты защиты проверяют, держатся ли ограничители под нагрузкой.

Ключевое слово во всей истории всё-таки «внутри». Разница между приглашённой проверкой и встроенной примерно такая же, как между приёмкой на выходе с завода и контролёром, который сидит в цеху весь цикл. Обещание Anthropic про embedded evaluators как раз про это: оценщик не приезжает на неделю перед релизом, а работает на месте постоянно.

Из формулировки анонса не разобрать, миллиард это общий счёт на двоих или столько с каждой стороны, и, на наш взгляд, для суммы такого масштаба разбивка напрашивалась сама собой. Не объяснено и то, как устроена независимость оценки, когда проверяющие сидят внутри проверяемой компании и работают по коммерческому договору.

Когда сядут первые оценщики

Горизонт объявлен пятилетний, а точек внутри него нет: дату, с которой команда Accenture приступает, Anthropic не назвала, графика найма тоже нет. Открытый вопрос в том, всплывут ли результаты этой работы в публичных материалах Anthropic о безопасности моделей или останутся внутренними. Пока из проверяемого есть только сумма и срок.

Читайте также

  1. Под вывеской студии дизайна ПО скрывался реселлер Claude
  2. Kimi K3 обучена на Claude незаконно, заявляет Anthropic
  3. Anthropic заплатит Akamai минимум 11,6 млрд долларов
  4. Anthropic снова берёт деньги за заблокированные запросы
  5. Союзники Трампа делают Амодеи лицом «ИИ-думеризма»
  6. Продавцы Amazon смогут вести магазин прямо в Claude

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.