Кратко
- NVIDIA выпустила открытую диффузионную языковую модель Nemotron-Labs-TwoTower — она пишет токены блоками параллельно, а не по одному, как обычные GPT-подобные модели.
- Throughput генерации выше в 2,42 раза по сравнению с авторегрессионным бэкграундом при сохранении 98,7% его качества по совокупности бенчмарков.
- Денойзер-башня обучена на ≈2,1 трлн токенов — против 25 трлн токенов, на которых предобучен базовый бэкграунд Nemotron-3-Nano-30B-A3B.
- Модель весит открыто под лицензией NVIDIA Nemotron Open Model License; попробовать похожий принцип «спросить и получить быстрый ответ» можно прямо сейчас в чате Veruna AI.
Если коротко: NVIDIA взяла свою открытую модель Nemotron-3-Nano-30B-A3B и приделала к ней вторую «башню», которая умеет писать сразу блок токенов, а не ждать, пока предыдущий токен полностью досчитается. В результате модель отвечает почти вдвое быстрее, почти не теряя в качестве ответов.
Что за релиз и почему NVIDIA сделала не одну модель, а две «башни»
1 июля 2026 года NVIDIA Research опубликовала Nemotron-Labs-TwoTower — диффузионную языковую модель, построенную поверх открытого гибридного бэкграунда Nemotron-3-Nano-30B-A3B. Само название отражает архитектуру: TwoTower буквально означает «две башни». Подробное описание архитектуры и все цифры ниже — из технического отчёта на arXiv.
Обычная языковая модель — что GPT, что Claude, что Nemotron в стандартном режиме — генерирует ответ последовательно: считает вероятности для одного токена, добавляет его к тексту, потом считает следующий, и так до конца ответа. Это называется авторегрессией (AR), и именно она много лет была стандартом для больших языковых моделей.
У предыдущих попыток скрестить диффузию с языковыми моделями была общая проблема: одна и та же сеть должна была одновременно и держать в памяти контекст разговора, и разбираться с шумными, недописанными кусками текста при денойзинге. Две разные задачи тянула одна архитектура — и обе страдали от нехватки «специализации».
TwoTower разводит эти задачи по разным блокам. Первая часть — замороженная AR-башня контекста: по сути, исходная Nemotron-3-Nano-30B-A3B без изменений, она читает уже написанный, чистый текст последовательно и держит KV-кеш и состояния Mamba, как обычная модель. Вторая часть — обучаемая башня-денойзер, отдельный блок, который смотрит на зашумлённый (частично замаскированный) блок токенов и восстанавливает его целиком за несколько шагов, используя двунаправленное внимание внутри блока и послойное cross-attention к башне контекста.
Обе башни — это 52-слойные гибридные блоки (23 слоя Mamba-2, 6 слоёв self-attention, 23 слоя MoE с 128 маршрутизируемыми экспертами, из которых на каждый токен активируются 6, плюс 2 общих эксперта). Итоговый чекпоинт со всеми весами обеих башен — около 60 млрд параметров, из которых на конкретный токен реально работает около 3 млрд активных параметров на башню.
Как работает параллельная генерация текста
Смысл диффузионного подхода к тексту такой же, как у диффузионных моделей для картинок, только вместо пикселей — токены. Вместо того чтобы писать ответ слово за словом, TwoTower:
- Берёт блок из нескольких «пустых» (замаскированных) позиций — по умолчанию 16 токенов.
- За несколько итераций одновременно «угадывает» содержимое всего блока, постепенно уточняя те токены, в которых модель ещё не уверена — механизм называется confidence-based token commitment: сначала фиксируются токены с высокой уверенностью, менее очевидные додумываются на следующих шагах.
- Когда блок дописан начисто, он передаётся в AR-башню контекста — та обновляет своё состояние и открывает дорогу для генерации следующего блока.
Ключевая идея — генерация внутри блока идёт не строго слева направо, а сразу по всем позициям блока с последующим уточнением. Это и даёт параллелизм: вместо N последовательных шагов для N токенов модель делает заметно меньше шагов денойзинга на блок из 16 токенов.
Именно поэтому диффузионные языковые модели в принципе интересны индустрии: авторегрессионная генерация имеет задержку, которая линейно растёт с длиной ответа, а параллельная генерация блоками теоретически может сжать это время. На практике выигрыш зависит от реализации — ранние диффузионные LLM часто оказывались медленнее AR-моделей из-за большого числа шагов денойзинга, и индустрия последние пару лет активно ищет способы сократить это число шагов, не потеряв в качестве.
Цифры релиза: throughput, качество и объём обучения
NVIDIA в анонсе и технический отчёт по TwoTower сходятся в трёх ключевых цифрах.

Источник: NVIDIA Research, техотчёт Nemotron-Labs-TwoTower (arXiv 2606.26493)
Прирост не бесплатный — блочная диффузия тратит на денойзинг больше вычислений на шаг, чем один forward pass AR-модели. Но за счёт параллельной генерации внутри блока итоговый wall-clock throughput всё равно оказывается выше почти в 2,5 раза при том же железе (2×H100, около 59 ГБ на GPU в BF16 для полного двухбашенного режима; AR-only режим для сравнения помещается в одну карту на 80 ГБ).
Второй важный вопрос — что происходит с качеством ответов при ускорении. Здесь NVIDIA приводит агрегированную метрику по всем сравниваемым бенчмаркам.

Источник: NVIDIA Research, техотчёт Nemotron-Labs-TwoTower (arXiv 2606.26493)
По разбивке из технического отчёта картина неровная, но предсказуемая: на задачах общих знаний просадка минимальна (около 1 пункта), на коде и математике — чуть заметнее, а вот на бытовой логике (commonsense) и мультиязычных задачах TwoTower местами даже обгоняет AR-бэкграунд. Это похоже на побочный эффект того, что денойзер видит блок целиком и может учитывать более поздний контекст внутри блока — то, чего строго последовательная AR-генерация в принципе не умеет.
Третья цифра — объём обучения. Дообучать пришлось не всю модель, а только денойзер-башню: контекстная башня осталась замороженной копией исходной сети. На это ушло около 2,1 трлн токенов — заметно меньше, чем 25 трлн токенов, на которых с нуля предобучен сам бэкграунд Nemotron-3-Nano-30B-A3B. По сути, NVIDIA переиспользовала уже обученную модель и «пристроила» к ней параллельную генерацию отдельным, сравнительно недорогим этапом обучения.
Что теряется в обмен на скорость
Ускорение почти в 2,5 раза не даётся бесплатно — в техническом отчёте прямо перечислены ограничения. Блок нельзя увеличивать бездумно: дефолтный размер — 16 токенов, и при попытке поднять его выше качество генерации резко проседает, то есть максимальный параллелизм упирается именно в этот параметр, а не растёт линейно с размером блока. Память при этом съедается сильнее: модель держит в памяти веса сразу двух башен вместо одной, поэтому полный двухбашенный режим требует 2 GPU и заметно больше видеопамяти, чем обычный авторегрессионный инференс той же базовой модели. И остаётся левосторонняя предвзятость (left-to-right bias): несмотря на параллельную генерацию внутри блока, порядок обработки блоков всё ещё последовательный, слева направо, а это может ограничивать разнообразие генерации по сравнению с полностью недетерминированными подходами.
Иными словами, TwoTower — это не «диффузия во всех смыслах превосходит авторегрессию», а конкретный инженерный компромисс: NVIDIA выбрала конфигурацию (блок 16, две башни на 2 GPU), при которой прирост скорости перевешивает потери качества и памяти. Это не единственный эксперимент компании в эту сторону: ещё в мае 2026 года NVIDIA выпустила линейку Nemotron-Labs Diffusion (3B/8B/14B) с тремя режимами декодирования — авторегрессионным, диффузионным и self-speculation. Получается, что ставка на параллельную генерацию текста для NVIDIA — не разовый релиз, а рабочее направление исследований, которым компания занимается уже больше года.
Зачем это обычному пользователю, а не только инженерам
Для большинства людей, которые просто печатают вопрос в чат и ждут ответ, детали архитектуры не так важны, как результат: более быстрый и при этом почти такой же качественный ответ. Именно ощущение задержки — то самое время, за которое модель «допечатывает» ответ, — сильнее всего сказывается на впечатлении от чат-бота, особенно на длинных ответах: код, развёрнутое объяснение, черновик текста.
Практический смысл разработок вроде TwoTower не в том, что конкретно эта модель завтра появится в каждом продукте, а в том, что весь класс диффузионных языковых моделей постепенно доказывает: параллельная генерация текста — не тупиковая ветка, а рабочий способ снизить задержку инференса без переобучения модели с нуля. Скорее всего, удачные архитектурные находки такого рода со временем перекочуют и в другие модели, в том или ином виде.
Как попробовать разные подходы к генерации текста прямо сейчас
Пока экспериментальные архитектуры вроде TwoTower проходят путь от исследовательской статьи до продакшена, самый практичный способ ощутить разницу между моделями — не разбираться в архитектуре каждой из них самому, а иметь под рукой единую точку входа сразу ко многим нейросетям. Veruna AI — это как раз такой чат: 100+ моделей, включая ChatGPT, Claude, Gemini, DeepSeek, Grok и другие, в одном окне, без VPN и с оплатой в рублях. Не нужно регистрироваться отдельно в каждом сервисе, чтобы сравнить, как разные модели справляются с одной и той же задачей — код, текст, разбор изображения.
Начать можно бесплатно: гостевой чат работает без регистрации, а токены дают за создание аккаунта и выполнение заданий. Актуальные условия и состав моделей — на главной странице Veruna AI.
Где параллельная генерация текста уже пригодится
Параллельная генерация особенно заметна там, где важна скорость первого черновика — код, текст, разбор изображения, — а не точность до последней запятой: пока ответ обычной модели «допечатывается» построчно, генерация блоками уже сокращает время ожидания. Чем длиннее ответ, тем заметнее накопленная задержка авторегрессии — и тем больше выигрыш от параллельного подхода в относительных числах.
Есть и более прикладной случай: исследовательские и инженерные команды, которые сами разворачивают открытые модели. Лицензия NVIDIA Nemotron Open Model License позволяет брать веса и адаптировать архитектуру под свои задачи, не дожидаясь, пока подход появится в готовых коммерческих продуктах.
Частые вопросы
Diffusion-модели — это то же самое, что генераторы картинок вроде Stable Diffusion? Общий только принцип — постепенное «расшумление» из зашумлённого состояния к чистому результату. Для картинок расшумляются пиксели, для текста — замаскированные токены. Архитектуры и обучение при этом совсем разные.
TwoTower заменит обычные языковые модели вроде GPT или Claude? Пока нет оснований так говорить. Это открытый исследовательский релиз с конкретными компромиссами (блок токенов ограничен 16, нужна вторая GPU под вторую башню). Скорее это демонстрация подхода, который со временем может повлиять на архитектуру будущих моделей.
Почему прирост именно 2,42 раза, а не больше? Число зависит от конкретной конфигурации — размера блока (16 токенов) и коэффициента γ=0,8, при которых NVIDIA замеряла wall-clock throughput на 2×H100. При других настройках соотношение скорости и качества смещается: NVIDIA прямо пишет, что увеличение блока сверх 16 токенов резко ухудшает качество генерации.
Можно ли уже использовать Nemotron-Labs-TwoTower в проде? Веса открыты под лицензией NVIDIA Nemotron Open Model License, так что технически развернуть модель может любая команда с подходящим железом (2 GPU с ~59 ГБ памяти каждая в BF16). Но это исследовательский релиз, а не готовый продукт с SLA и поддержкой.
Что делать, если не хочется разбираться в архитектурах моделей, а нужен просто быстрый и качественный ответ? Для этого не обязательно следить, какая модель диффузионная, а какая авторегрессионная — можно спросить прямо в чате с ассистентом Veruna AI ниже и получить ответ от одной из актуальных нейросетей, не выбирая архитектуру вручную.
