Модель с 550 миллиардами параметров построена на архитектуре Mamba 2 и использует технику mixture-of-experts. При работе активируются 55 миллиардов параметров, что ускоряет инференс по сравнению с предыдущим поколением.
Модель поддерживает контекстное окно до 1 миллиона токенов и обучена на 14.8 триллионах токенов. Она понимает 12 естественных и 43 языка программирования. Nvidia утверждает, что использование Nemotron 3 Ultra может снизить затраты на токены до 30 процентов по сравнению с аналогами.
Веса и рецепты обучения доступны по лицензии OpenMDW-1.1. Модель размещена на Hugging Face, ModelScope и OpenRouter. По результатам теста GDPVal модель набирает 47.9 процента, уступая GPT-5.5 с показателем 84.9 процента.

