Grok Imagine научился собирать видео по одному текстовому описанию, без стартовой картинки, и выдавать нативные 1080p. Режим Multi-Reference принимает до семи референсов (образцов для подражания) в одной генерации: одно изображение удерживает лицо, другое товар, третье локацию.
Если подать изображение персонажа вместе с образцом голоса, модель сохраняет то же лицо и тот же голос в разных сценах, заявляет xAI. Референсы по картинке и голосу включают в США для подписчиков SuperGrok Heavy и SuperGrok Plus на сайте Imagine и в приложении для iOS, на остальные тарифы их обещают открыть в ближайшие дни.
Генерация из текста и 1080p уже открыты всем на вебе, iOS и Android. В API xAI референсы по изображению, генерация из текста и 1080p доступны в модели grok-imagine-video-1.5, голосовые референсы выдают по отдельному запросу.

