Перейти к содержанию

model-releases

Embed 5 от Cohere делит индекс и поиск между двумя моделями

Promtime

Документы в индекс кладёт одна модель, запросы по нему обрабатывает другая, на треть дешевле, и качество поиска в тестах Cohere падает всего на 1,6 пункта из 100. Так устроено новое семейство Embed 5, о котором пишет The New Stack: Embed 5 Pro индексирует, Embed 5 Fast отвечает на запросы к тем же векторам, и второй индекс не нужен.

Коротко

  • В семействе Embed 5, вышедшем в среду, две модели, Pro и Fast, пишут векторы в общее пространство, поэтому их можно менять местами без повторного эмбеддинга всего корпуса.
  • Pro стоит 0,12 доллара за миллион токенов, Fast 0,08 доллара, а на 40 наборах данных Cohere связка «Pro индексирует, Fast ищет» набрала 98,4 против 100 у схемы «Pro на всё».
  • Все цифры посчитаны на собственных тестах Cohere и разными метриками, которые напрямую не сравнимы, поэтому связку Pro и Fast придётся проверять на своём корпусе и своих запросах.

Если вы не следили за эмбеддингами: модель превращает текст или картинку в вектор, набор чисел, и поиск сводится к тому, чьи векторы ближе к вектору запроса. Сравнивать, как правило, можно только векторы одной модели, поэтому смена модели обычно означает переэмбеддинг всего корпуса. Предыдущим поколением у Cohere была Embed 4, и в одном из тестов ниже она отстаёт от Embed 5 Pro на 8,8 пункта.

Связка Pro и Fast теряет 1,6 пункта из 100 на 40 наборах данных

Cohere советует индексировать документы моделью Pro, а запросы отдавать Fast, особенно в RAG и агентах, где одни и те же данные ищут снова и снова и задержка накапливается. Pro стоит 0,12 доллара за миллион токенов, Fast 0,08 доллара, а пропускная способность Fast по документам в тестах Cohere в среднем в 2,4 раза выше.

Качество проверяли на 40 наборах данных с текстом, изображениями, смешанными и распарсенными документами. Если за базу принять схему «Pro на всё» со счётом 100, то запросы Fast по индексу Pro дают 98,4, а Fast на обоих концах 96,6. По словам Cohere, ни на одном отдельном наборе связка Pro и Fast не показала серьёзного провала.

Логика раздела нагрузки простая: в RAG-системе новые документы поступают в индекс реже, чем по ним ищут. Pro обрабатывает документы на входе, а Fast берёт на себя куда более плотный поток запросов.

100 миллионов фрагментов весят 819 ГБ во float32 на 2 048 измерениях и 3,2 ГБ в бинарном виде на 256

Обе модели выдают векторы шести размерностей, от 256 до 2 048, в форматах float32, int8 и бинарном. По подсчёту Cohere, вектор на 2 048 измерений во float32 весит 8 КБ, и 100 миллионов фрагментов займут примерно 819 ГБ. Тот же корпус на 1 024 измерениях в int8 ужимается примерно до 102 ГБ, а на 256 измерениях в бинарном формате примерно до 3,2 ГБ.

Для большинства развёртываний Cohere рекомендует 1 024 измерения в int8: памяти и диска нужно меньше, а качество поиска остаётся близким к полной точности. Бинарные векторы сжимают сильнее, но теряют в точности, и их советуют ставить на первый этап отбора, после которого идёт переранжирование с более высокой точностью.

На смешанных текстово-визуальных данных Pro набрала 82,3, Gemini Embedding 2 только 61,3

Embed 5 работает с текстом, изображениями и их сочетанием на более чем 100 языках, окно контекста 128 тысяч токенов. Модели умеют эмбеддить изображения страниц напрямую или сводить картинку и текст в один вектор. На пяти наборах смешанных текстово-визуальных данных Pro набрала в среднем 82,3, Fast 81,2, Gemini Embedding 2 от Google 61,3.

На распарсенных PDF у Pro 84,8, у Voyage 4 Large 83,6, у Fast 83,4, у Gemini Embedding 2 80,8. На ViDoRe V3, который Cohere прогоняла по распарсенному тексту от авторов бенчмарка, без изображений страниц, у Pro в среднем 85,8, у Fast 84,5, у Voyage 4 Large 83,7, у Gemini Embedding 2 83,2 и у прошлой Embed 4 77.

С языками картина ровнее, и The New Stack отмечает это на фоне недавнего захода Cohere в машинный перевод. В среднем по пяти европейским языкам Pro впереди с 77 против 76 у Voyage 4 Large и 73 у Gemini Embedding 2, но в девяти тестах уступает Gemini Embedding 2.

Embed 5 первой у Cohere оценивали метрикой RCP-nDCG@10

Обычная nDCG@10 показывает, насколько удачно правильные документы расставлены среди первых десяти результатов. RCP-nDCG@10 судит о релевантности по критериям, составленным под каждый конкретный запрос, вместо заранее расставленных меток. По словам Cohere, так находятся релевантные результаты, которые исходные метки бенчмарка пропускали. Но эта метрика меряет переранжирование внутри фиксированного набора кандидатов, а не первичный поиск по всему корпусу.

Первичный поиск Cohere оценивала отдельно, стандартными nDCG и Recall. Тесты на смешанных данных, на изображениях страниц и на связке разных моделей шли по стандартной nDCG@10. Поэтому оценки из разных таблиц напрямую сравнивать нельзя.

Почему Fast может искать по индексу Pro

Pro и Fast делят одно пространство эмбеддингов и выдают векторы одинаковой размерности. Вектор запроса от Fast сравнивается с векторами документов от Pro так же, как если бы их сделала одна модель. Представьте двух картографов, которые работают на одной карте: один рисует подробнее, другой быстрее, но координаты у них общие, и точку, отмеченную одним, найдёт второй.

Второе свойство касается сжатия. Матрёшечное усечение (Matryoshka) устроено так, что самые важные сведения собраны в начале вектора, и его можно обрезать до меньшей размерности без переобучения модели. Формат int8 хранит каждое число в одном байте вместо четырёх. По словам Cohere, смешивать Pro и Fast можно и при усечении, и при int8.

На практике индексирование и обслуживание запросов превращаются в два отдельных инфраструктурных решения. Корпус индексируют ради качества поиска, а путь запроса настраивают на пропускную способность и задержку, не держа две копии данных.

Цифра 98,4 усреднена по собственным тестам Cohere, а разбивки по отдельным наборам для связки в материале нет, есть лишь заверение, что серьёзных провалов не было. В продакшене RAG и агентов связку придётся сравнить со схемой «Pro на всё» на своём корпусе и своих запросах, особенно где ошибка поиска тянется через несколько шагов агента. На наш взгляд, цена здесь меньший аргумент, чем скорость: запрос через Fast дешевле на треть, а пропускная способность по документам выше в 2,4 раза.

Сколько останется от 98,4 на ваших данных

Embed 5 Pro и Fast доступны через API Cohere и Model Vault, в Microsoft Foundry и Amazon SageMaker, а для частного VPC и своих серверов есть развёртывание через vLLM. Открытым остаётся вопрос, во что превратятся 1,6 пункта разницы на реальных запросах: ответ даст только сравнение Pro с Fast и Pro с Pro на собственном корпусе.

Читайте также

  1. Переводчик Cohere не рассуждает, и это ради экономии
  2. OpenRouter представил режим Fusion
  3. Sonnet 5.5 обошёл Opus 5.5 в Terminal-Bench 4.0
  4. GLM 5.3 подписал коммит именем Claude Fable 5
  5. Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
  6. Codex после сжатия вспомнил 68 ответов из 178

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.