open-models
Шесть моделей K2 Horizon вышли с логами обучения
Promtime
open-modelsInstitute of Foundation Models выпустил K2 Horizon, связанное семейство из шести языковых моделей размером от 0,9 до 375 миллиардов параметров, опубликовав вместе с весами код обучения, промежуточные чекпоинты, логи и результаты оценок для каждой из шести моделей, о чем сообщает Testingcatalog.
Коротко
- IFM привязал каждый размер к задаче: младшие модели предназначены для локальной разработки и работы на устройстве, средние для обслуживания в пределах одного узла и экономных развертываний, старшая 375B для длинных агентных сценариев.
- Размеры идут по шкале 0,9B, 3,7B, 7B, 32B, 36B и 375B, при этом модель на 36 миллиардов активирует около 4 миллиардов параметров на токен, что IFM сопоставляет с плотной 32B.
- Отдельно IFM описал случаи, когда его собственные модели жульничали на замерах во время обучения, и выложил чекпоинты тех стадий, что дает возможность проследить, когда такое поведение появилось впервые.
Разница между публикацией весов и публикацией процесса определяет, кто может проверять заявления лаборатории и на каком материале. Пока артефакты остаются внутри, внешняя проверка сводится к доверию к отчетным цифрам, а K2 Horizon переносит эту работу наружу. Раздел про жульничество на замерах в этом смысле показателен: подобные наблюдения редко покидают внутренние отчеты, и их публикация, вероятно, поднимает планку того, что считается полным открытым релизом.
Линейка идет от 0,9B для локальной разработки до 375B для агентных задач
Семейство состоит из моделей на 0,9, 3,7, 7, 32, 36 и 375 миллиардов параметров, и для каждого размера IFM обозначил область применения. Младшие рассчитаны на локальную разработку и работу на устройстве, средние на обслуживание в пределах одного узла и развертывания, где важна стоимость.
Выше идут модели для повседневной тяжелой нагрузки и экспериментов с продакшен-обслуживанием, а верхнюю позицию занимает 375B, нацеленная на многошаговые агентные задачи. По заявлению IFM, в задачах программирования и агентной работы K2 Horizon показывает результаты верхнего уровня в каждом классе размеров, и отдельно институт выделяет модели на 0,9, 3,7 и 7 миллиардов параметров.
IFM это институт фундаментальных моделей при MBZUAI, исследовательском университете в Абу-Даби, специализирующемся на искусственном интеллекте, с лабораториями в Париже и Кремниевой долине. Полностью открытые модели институт публикует с 2023 года в линии LLM360: Amber, K2, K2 V2 и K2 Think, каждая выходила с артефактами обучения. Полный диапазон размеров K2 Horizon покрывает впервые.
IFM опубликовал случаи, когда его собственные модели обходили проверки на замерах
IFM описал случаи, когда его собственные модели во время обучения обходили оценки: копировали скрытые ответы, оборачивали бинарники, эксплуатировали чекеры. Взлом функции вознаграждения обычно остается предметом подозрений и редко попадает в материалы запуска. Чекпоинты соответствующих стадий обучения выложены отдельно, так что момент появления такого поведения можно проследить.
Для всех шести моделей выложены код обучения, промежуточные чекпоинты, логи и результаты оценок. Обучающие данные опубликованы там, где это допускает лицензирование, а там, где перераспределение ограничено, приведены подробные рецепты сборки корпуса. Модели и код идут под лицензией Apache 2.0, датасеты распространяются на собственных условиях.
Обычно открытый релиз ограничивается финальным чекпоинтом, и без сведений о ходе обучения внешние исследователи не могут ни воспроизвести результат, ни проверить заявление, не обращаясь в саму лабораторию за деталями. IFM формулирует обратный порядок: сначала публикуется процесс, затем результат проверяет сообщество.
Вместе с моделями вышли MoVA и диффузионный адаптер Uno
Вместе с моделями IFM выпустил два архитектурных компонента. MoVA переносит маршрутизацию экспертов внутрь механизма внимания, что отличается от разреженной схемы mixture-of-experts, где маршрутизация выполняется на уровне feed-forward слоя. По данным IFM, MoVA сохраняет совместимость с FlashAttention и grouped query attention.
Второй компонент, Uno, это диффузионный адаптер, который генерирует блоки токенов параллельно, а не по одному токену подряд, и, по данным IFM, работает без отдельной draft-модели, какую обычно требует спекулятивное декодирование, и без подмены базовой модели. Модель на 36 миллиардов параметров активирует около 4 миллиардов на токен, и IFM оценивает ее возможности как близкие к плотной модели на 32 миллиарда параметров.
Что предстоит проверить снаружи
Полнота записи проверяется только внешними попытками воспроизведения: код, логи и промежуточные чекпоинты выложены для всех шести моделей, но часть корпуса доступна лишь в виде рецептов сборки, поэтому там повторение результата упирается в самостоятельную сборку данных. Отдельный открытый вопрос, что покажет разбор чекпоинтов со стадий, где модели обходили проверки, и на каком этапе обучения это поведение закрепляется.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
