Gemma 4 от Google: линейка от 2,3B до 31B, MoE и режим мышления

Google выпустила открытую линейку Gemma 4 — от 2,3B до 31B, dense и MoE, контекст до 256K и режим мышления. Разбираем архитектуру, бенчмарки и запуск.

Нейросети и тренды
Gemma 4 от Google: линейка от 2,3B до 31B, MoE и режим мышления — иллюстрация к статье
11 мин чтения

13

Кратко

  • Google DeepMind выпустила Gemma 4 — открытую линейку моделей от 2,3 до 31 млрд параметров, впервые под чистой лицензией Apache 2.0 без ограничений на коммерческое использование.
  • В линейке есть и dense-модели (31B, 12B, E4B, E2B), и MoE-модель 26B A4B, которая активирует всего около 4 млрд параметров на токен, но по качеству почти не уступает полноразмерной 31B.
  • Модели умеют «думать» перед ответом через режим расширенного рассуждения и держат контекст до 256 000 токенов благодаря чередующемуся вниманию и урезанному RoPE.
  • Флагманская Gemma 4 31B поднялась на MMLU Pro с 67,6% у Gemma 3 27B до 85,2% — заметный скачок за одно поколение.

Gemma 4 — открытая линейка языковых моделей Google DeepMind, вышедшая в 2026 году под лицензией Apache 2.0: от компактной 2,3-миллиардной версии для смартфонов до 31-миллиардной для рабочих станций и серверов. Ниже — как устроена линейка, за счёт чего она держит длинный контекст без раздувания памяти, что показывают бенчмарки и как попробовать модель у себя или в браузере.

Что такое Gemma 4 и когда она вышла

Gemma 4 — это не одна модель, а семейство: Google выкатывала его волнами. Первая волна — E2B, E4B, MoE-модель 26B A4B и dense-модель 31B — вышла 2 апреля 2026 года (Google). Две недели спустя, 16 апреля, все четыре модели получили обновление с Multi-Token Prediction — техникой, которая ускоряет генерацию за счёт предсказания сразу нескольких токенов вперёд. А 3 июня 2026 линейку дополнила Gemma 4 12B Unified — модель с необычной архитектурой без отдельных энкодеров для видео и звука (ai.google.dev).

За линейкой стоит внушительная база: с момента запуска первой Gemma модели семейства скачали более 400 млн раз, а сообщество разработчиков создало свыше 100 000 собственных вариантов — так называемую Gemmaverse (Google Open Source Blog).

Линейка моделей: от 2,3B до 31B, dense и MoE

В Gemma 4 пять моделей, и они закрывают диапазон от смартфона до сервера с GPU.

МодельПараметрыАрхитектураКонтекст
E2B2,3 млрд эффективных (5,1 млрд с embeddings)Dense128K
E4B4,5 млрд эффективных (8 млрд с embeddings)Dense128K
12B Unified~12 млрдDense, без отдельных энкодеров256K
26B A4B26 млрд всего, ~4 млрд активных на токенMoE, 128 экспертов256K
31B31 млрдDense256K

Источник: Hugging Face, ai.google.dev.

Самое интересное здесь — модель 26B A4B. У неё 128 «экспертов» — специализированных подсетей, и обученный роутер выбирает для каждого токена только 8 из них плюс один общий эксперт, который активен всегда. В сумме на токен уходит вычислительная работа примерно 4 млрд параметров, а не 26 — хотя все 26 млрд всё равно должны быть загружены в память для быстрой маршрутизации.

На графике ниже видно, как растёт качество по мере увеличения модели: разрыв между компактной E2B и флагманской 31B на MMLU Pro — 25 процентных пунктов, но самое любопытное — насколько близко к 31B подбирается MoE-модель 26B A4B, работая при этом в разы дешевле по вычислениям.

Линейка Gemma 4: MMLU Pro по размерам моделей от E2B до 31B

Как Gemma 4 держит длинный контекст без раздувания памяти

Контекст 256K токенов у dense-модели — не тривиальная вещь: наивная реализация внимания требует памяти, которая растёт квадратично с длиной последовательности. У Gemma 4 несколько инженерных трюков решают эту проблему одновременно (Hugging Face).

Слои внимания чередуются: часть смотрит только на ближайшее окно в 512–1024 токена (локальное, дешёвое внимание), а часть — на весь контекст целиком (глобальное, оно и обеспечивает эффективную работу с длинными документами). Для позиционного кодирования локальные и глобальные слои используют разные версии RoPE, причём в глобальных слоях используется урезанная версия — pruned RoPE, — которая снижает позиционный шум на очень длинных последовательностях.

Отдельно модель экономит на KV-кэше — памяти, которая хранит промежуточные представления уже обработанных токенов. Последние слои переиспользуют кэш из более ранних слоёв вместо того, чтобы считать его заново, а в глобальных слоях query-группы делят один и тот же набор ключей и значений, что снижает объём кэша примерно вдвое. Плюс к этому — Per-Layer Embeddings: отдельная таблица эмбеддингов, которая подаёт сигнал в каждый слой отдельно, вместо того чтобы раздувать основные веса модели.

Результат заметен на бенчмарке долгого контекста MRCR v2 (поиск восьми «иголок» в стоге текста на 128 000 токенов): у 31B — 66,4% решённых задач, у компактной E2B — 19,1%. Разница ожидаема, но обе модели вообще способны работать с таким объёмом контекста, что для локально запускаемых открытых моделей ещё недавно было редкостью.

Мультимодальность и режим «мышления»

Все пять моделей Gemma 4 обрабатывают изображения — с переменным разрешением и настраиваемым числом токенов на картинку (70, 140, 280, 560 или 1120, в зависимости от того, нужна ли беглая оценка сцены или детальное чтение мелкого текста на диаграмме) — и видео. Три модели — E2B, E4B и 12B Unified — дополнительно понимают речь на слух через энкодер в духе USM. У 12B Unified при этом архитектура особенная: вместо отдельных энкодеров для видео и звука сырые фрагменты изображения и звуковая волна проецируются прямо в общее пространство эмбеддингов модели (Hugging Face).

Отдельная особенность — режим расширенного рассуждения, «мышление»: модель может генерировать промежуточные шаги через специальные токены перед тем, как выдать финальный ответ, вместо того чтобы отвечать «с ходу». В официальных бенчмарках thinking-версии моделей (например, gemma-4-31B-thinking) оцениваются отдельно от базовых — включённое рассуждение ощутимо поднимает результат на задачах вроде AIME, где нужно решать многошаговую математическую задачу, а не угадывать ответ с первой попытки (ai.google.dev). Модели также нативно обучены на 140+ языках.

Gemma 4 против Gemma 3 и открытых конкурентов

Разница с предыдущим поколением получилась резче, чем обычно бывает между соседними версиями одной линейки. На MMLU Pro Gemma 3 27B показывала 67,6%, Gemma 4 31B — 85,2%: скачок на 17,6 процентного пункта. На AIME 2026 разница ещё заметнее — с 20,8% у Gemma 3 до 89,2% у Gemma 4. На лидерборде LMArena Gemma 3 27B держала 1365 очков Elo, а Gemma 4 31B поднялась до 1452 и заняла третье место среди открытых моделей мира — в то время как MoE-модель 26B A4B набрала 1441 и заняла шестое, обгоняя по этому показателю модели в 20 раз крупнее себя (DeepMind, Google).

Gemma 3 → Gemma 4: разница по MMLU Pro, AIME 2026 и Arena Elo

Среди открытых конкурентов ближе всего к Gemma 4 подобралась китайская линейка Qwen 3.5: по независимым замерам её модель на 27B параметров немного впереди на MMLU Pro (86,1% против 85,2%) и GPQA Diamond (85,5% против 84,3%), но Gemma 4 31B заметно сильнее в математике и коде — 89,2% на AIME 2026 против примерно 49% у Qwen на AIME 2025 и рейтинг 2150 Elo на Codeforces. Llama 4 Scout от Meta по чистым бенчмаркам отстаёт (74,3% на GPQA Diamond), зато берёт контекстным окном — по заявлению разработчика, до 10 млн токенов, — и здесь её главный козырь не качество, а масштаб контекста (ai.rs).

Независимая академическая проверка на паре других бенчмарков (ARC-Challenge, GSM8K) в целом подтверждает картину: компактная Gemma-4-E4B и MoE-модель 26B A4B при разумном промптинге стабильно опережают модели сопоставимого размера вроде Phi-4 и Qwen3-8B, при этом Gemma-4-E4B даёт едва ли не лучшее соотношение точности и потребления памяти во всей выборке — около 14,9 ГБ VRAM на пике (arXiv).

Лицензия Apache 2.0 — что это меняет

До Gemma 4 модели линейки распространялись по собственным условиям Google — Gemma Terms of Use, с формулировками, которые часть разработчиков считала недостаточно прозрачными для встраивания в коммерческие продукты. С Gemma 4 Google перешла на чистый Apache 2.0 — ту же лицензию, что использует, например, Qwen 3.5 (Google Open Source Blog).

Разница ощутима на практике. Apache 2.0 не вводит порогов по числу пользователей или выручке — можно дообучить модель, оставить веса закрытыми и встроить в свой продукт без отдельного соглашения с Google. Для сравнения, у Llama 4 от Meta лицензия по-прежнему требует отдельного коммерческого договора, если у продукта больше 700 млн активных пользователей в месяц. Для подавляющего большинства команд это будет неактуально ещё очень долго, но сам факт такого порога — принципиальное отличие условий.

Как попробовать Gemma 4

Открытые веса Gemma 4 доступны на Hugging Face и Kaggle, включая варианты с квантизацией под слабое железо (QAT). Запустить локально проще всего через Ollama или LM Studio.

С Ollama всё сводится к паре команд в терминале: скачать нужный размер (ollama pull gemma4:e4b, ollama pull gemma4:26b или ollama pull gemma4:31b) и запустить — модель сразу открывает интерактивный диалог. LM Studio удобнее для тех, кто не хочет работать через терминал: программа сама подбирает подходящий уровень квантизации под доступную память устройства и даёт готовый чат-интерфейс за несколько минут (Habr). Оба варианта бесплатны и работают полностью офлайн — без подписок и токенных лимитов, потому что вся вычислительная нагрузка ложится на собственное железо.

Здесь стоит понимать важную вещь: Gemma — открытая линейка именно для локального и self-hosted запуска, а не облачный сервис Google. Если нужен не локальный запуск, а быстрый доступ к моделям Google прямо в браузере без установки, для этого у Google есть отдельное, проприетарное семейство — Gemini. Оно уже в каталоге Veruna AI: несколько версий Gemini выбираются прямо в чате рядом с моделями OpenAI, Anthropic и других разработчиков, без иностранной карты и VPN, с оплатой в рублях. Veruna AI — это единая точка входа сразу ко многим нейросетям: не нужно заводить отдельный аккаунт под каждую модель, чтобы сравнить, как разные ИИ справляются с одной и той же задачей. Начать можно бесплатно и без карты — гостевой чат открыт сразу, а часть токенов дают за регистрацию.

Короткие сценарии

Локальный ассистент без интернета. Нужно работать с чувствительными документами или просто не хочется зависеть от облака — Gemma 4 E4B или 26B A4B в Ollama или LM Studio справляется с большинством повседневных задач на обычном ноутбуке.

Мобильные и встраиваемые приложения. Компактные E2B и E4B заточены под работу на устройствах с ограниченными ресурсами — от смартфонов до Raspberry Pi, — сохраняя разумное качество ответов при низком расходе памяти и энергии.

Коммерческий продукт на открытой модели. Лицензия Apache 2.0 без ограничений по числу пользователей позволяет дообучить Gemma 4 под свою задачу и встроить в закрытый продукт, не согласовывая это отдельно с Google.

Быстрое сравнение моделей Google. Хочется сопоставить ответ Gemini с другими нейросетями на одну и ту же задачу без переключения между сайтами — для этого в одном чате Veruna AI можно задать один и тот же вопрос Gemini, ChatGPT и Claude подряд.

Частые вопросы

Что такое Gemma 4? Gemma 4 — открытая линейка языковых моделей Google DeepMind: пять размеров от 2,3 до 31 млрд параметров, dense и MoE архитектуры, с поддержкой изображений, видео и (у части моделей) звука. Веса распространяются под лицензией Apache 2.0 и доступны для скачивания и запуска на собственном оборудовании.

Чем Gemma 4 отличается от Gemma 3? Главное отличие — резкий скачок качества: на MMLU Pro флагманская модель поднялась с 67,6% до 85,2%, а на AIME 2026 — с 20,8% до 89,2%. Также в Gemma 4 появилась MoE-архитектура (26B A4B), режим расширенного «мышления» и контекст до 256 000 токенов вместо более скромного у Gemma 3.

В чём разница между dense и MoE-моделью в линейке Gemma 4? Dense-модели (E2B, E4B, 12B, 31B) используют все свои параметры на каждом токене. MoE-модель 26B A4B устроена иначе: из 128 «экспертов» на каждый токен активируются только 8 плюс один общий — то есть реальная вычислительная нагрузка на инференсе сопоставима с моделью в 4 млрд параметров, а качество близко к 31B dense.

Можно ли использовать Gemma 4 в коммерческом продукте? Да, без ограничений. С Gemma 4 Google перешла на лицензию Apache 2.0 — она разрешает дообучивать модель, оставлять веса закрытыми и встраивать в платный продукт без отдельного соглашения с Google и без порогов по числу пользователей.

Можно ли попробовать модели Google в браузере без установки? Саму Gemma 4 — только локально: это открытая модель для запуска на собственном железе, а не облачный сервис. А вот проприетарное семейство Gemini от того же Google доступно прямо в браузере через Veruna AI — без VPN, без иностранной карты и без установки чего-либо на компьютер.

Gemma 4 от Google: линейка от 2,3B до 31B, MoE и режим мышления — Veruna AI