research

150 млн параметров дают 29,5% pass@2 на ARC-AGI-1

Promtime

research

Согласно препринту, страница которого выложена на Huggingface, модель рассуждений BDH-CQ в конфигурации на 150 млн параметров набирает 29,5% pass@2 на публичном наборе ARC-AGI-1 при расчётной стоимости вывода $0,0007 за задачу и, по утверждению авторов, пробивает ранее опубликованную границу цены и точности для этого бенчмарка.

Коротко

  • Архитектура совмещает обучение в контексте с рекуррентными рассуждениями: примеры, поданные на входе во время вывода, непрерывно обновляют рекуррентную память, из которой затем выводится нужное преобразование, без проговаривания промежуточных шагов.
  • Заявленный операционный режим сводит вместе конфигурацию на 150 млн параметров, 29,5% pass@2 на публичном наборе ARC-AGI-1 и стоимость вывода $0,0007 за задачу, посчитанную самими авторами.
  • Препринт выложен на arXiv под номером 2608.09888, вместе с ним доступны страница проекта и репозиторий на GitHub, а на Huggingface работа уже включена в семь коллекций.

Почему это важно Стоимость решения задачи давно стала отдельной осью сравнения моделей рассуждений наряду с точностью, и заявка на 150 млн параметров расходится с привычной логикой, где качество на ARC-AGI покупается длинными цепочками токенов. Если цифры воспроизведутся, это выглядит как аргумент в пользу рекуррентных скрытых вычислений против текстового проговаривания шагов. Пока речь идёт о препринте и о самостоятельно посчитанной авторами стоимости вывода, а не о независимом замере.

По описанию авторов, входные примеры, предъявленные во время вывода, непрерывно обновляют рекуррентную память BDH-CQ, и обучение в контексте в этой схеме совмещено с рекуррентными рассуждениями. Сам запрос модель решает итеративными вычислениями в многомерном скрытом пространстве, а промежуточные шаги при этом не выводятся в текст.

Заявленные результаты получены на конфигурации в 150 млн параметров, а стоимость вывода в $0,0007 за задачу в самой работе названа расчётной. Авторы описывают эту точку как новое состояние дел по стоимостной эффективности на ARC-AGI-1: по их измерениям, ранее опубликованная граница цены и точности пройдена.

Оценку проводили на публичном наборе ARC-AGI-1, где конфигурация на 150 млн параметров набрала 29,5% pass@2. Помимо этого прогона в работе задействованы контролируемые ARC-подобные вмешательства: с их помощью авторы разбирают, что именно модель извлекает из демонстраций и насколько последовательно применяет выведенное преобразование к новому запросу.

Отдельная часть тех же экспериментов посвящена концептам, которые остаются для модели трудными. На Huggingface работа включена в семь коллекций, при этом ни одна модель, ни один датасет и ни один Space на платформе на неё не ссылаются.

Что дальше Измерения в препринте ограничены публичным набором ARC-AGI-1 и контролируемыми ARC-подобными сценариями, поэтому поведение BDH-CQ на закрытых наборах остаётся открытым вопросом. Работы на arXiv выходят без рецензирования, поэтому заявленную точку цены и точности, вероятно, предстоит подтверждать независимыми прогонами. Сведений о выпуске весов, планах по масштабированию конфигурации или коммерческом доступе в аннотации нет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.