Нейросеть рисует по описанию: что она молча заменяет в запросе

Один запрос про двор пятиэтажки в шести нейросетях: иномарку нарисовали две модели, раму для ковров — пять, пять этажей — ни одна. Что модель заменяет молча.

Изображения
Нейросеть рисует по описанию: что она молча заменяет в запросе — иллюстрация к статье
9 мин чтения

11

Кратко

  • Один запрос с пятью проверяемыми деталями отдали шести нейросетям для генерации изображений: по одному прогону на модель, без вторых попыток.
  • Лавочку, пожилую женщину и бельё на верёвке нарисовали все шесть.
  • Старую иномарку у подъезда — только две модели, остальные поставили туда отечественную машину.
  • Раму для выбивания ковров собрали пять моделей из шести, шестая заменила её бельевой сушилкой. Пять этажей не подтвердились ни на одной картинке.

Расхождение с запросом не выглядит ошибкой

Когда нейросеть рисует картинку по описанию, промах обычно незаметен. Пальцы на месте, свет живой, штукатурка облезает правдоподобно — а часть заказанного тихо заменена на что-то другое, и никакого предупреждения об этом нет. Модель не сообщает, что чего-то не поняла или не знала: она рисует замену с той же уверенностью, с какой рисует всё остальное.

Чтобы посмотреть, что именно теряется по дороге от текста к изображению, мы взяли один запрос и отдали его шести моделям. Сцену выбрали намеренно локальную — двор старой пятиэтажки. В ней есть детали, которые встречаются в любой стране, и детали, которых в мировом фотобанке почти нет.

Что проверяли: один запрос, шесть нейросетей для генерации изображений

Запрос написали один раз и дальше не трогали, на английском. В нём было пять проверяемых пунктов: двор российской пятиэтажки летом, снято на телефон; деревянная лавочка у подъезда, на ней сидит пожилая женщина; между двумя деревьями верёвка с бельём; металлическая рама для выбивания ковров, на ней ковёр; у дома припаркована старая иномарка.

Пункты подобраны не наугад. Лавочка, пожилая женщина и бельё есть в кадрах из любой страны — это проверка на то, что модель вообще поняла задачу. Рама для ковров — предмет без прямого западного аналога, его надо знать. «Старая иномарка» прямо противоречит тому, что обычно стоит в кадре с подписью «российский двор». А «пятиэтажка» — единственный пункт, который просто пересчитывается.

Участников шесть, все разных вендоров: GPT Image 2 (генерация фото в чате GPT от OpenAI), Nano Banana Pro (та самая nano banana — картиночная модель Gemini от Google), Qwen 2 от Alibaba, Seedream v4 от ByteDance, Grok Imagine (картинки у нейросети Grok от xAI) и FLUX.2 Max от Black Forest Labs.

Ограничение теста назовём сразу: по одному прогону на модель, без вторых попыток и без правок результата. Этого достаточно, чтобы увидеть, какие пункты запроса ломаются у нескольких моделей подряд, но недостаточно для рейтинга — рейтинга здесь и нет.

Нейросеть GPT Image 2 нарисовала двор пятиэтажки по описанию: бабушка на лавочке, бельё на верёвке, ковёр на раме и синяя «Нива»
GPT Image 2, картиночная модель OpenAI. Ковёр на раме — как заказывали. Иномарка превратилась в «Ниву».

Что нейросеть рисует по описанию без осечек

Первые три пункта закрыли шесть моделей из шести. Лавочка у подъезда есть везде, пожилая женщина на ней тоже, бельё на верёвке тоже.

Дальше начинаются мелочи. Платок на голову женщине добавила половина моделей, хотя в запросе его не было: в мировом запасе кадров «пожилая женщина, Россия, двор» платок встречается чаще, чем его отсутствие, — вот он и приехал в комплекте. Формулировка «между двумя деревьями» соблюдена не везде: у трёх моделей верёвка идёт от дерева к стене дома или к столбу. Мелочь, но показательная — в запросе стояла конкретная конструкция, а нарисован общий смысл «бельё сушится во дворе».

Отдельного упоминания стоит Qwen 2: её двор получился самым достоверным из шести. Яркое разноцветное бельё на прищепках, деревянная лавка на чугунных ножках, объявление на двери подъезда, трещины на отмостке. Без контекста эту картинку легко принять за телефонный снимок.

Прямое указание против статистики: иномарка

Слово «иномарка» стояло в запросе прямым текстом. Нарисовали её две модели из шести.

Nano Banana Pro поставила у дома ржавую Audi 100 — с фирменными кольцами на решётке, с выгоревшей краской, ровно ту машину, которая в таком дворе и стояла бы. Grok Imagine выдал зелёный Volkswagen Passat, тоже без вопросов.

Нейросеть Nano Banana Pro нарисовала двор по описанию: бабушка на лавке, ковёр на металлической раме и ржавая Audi у подъезда
Nano Banana Pro — та самая nano banana, генерация изображений у Gemini. Единственная, кто прочитал «иномарку» буквально. Песочницу с игрушками дорисовала сама.

Остальные четыре молча поправили запрос. GPT Image 2 — синяя «Нива». Qwen 2, Seedream v4 и FLUX.2 Max — «Жигули» разных лет и цветов: бежевые, голубые, белые. Ни одна модель не отметила, что заменила заказанное.

Тут стоит остановиться, потому что это не ошибка распознавания. Слово было понято — просто в кадрах, которые модель видела под подписью «российский двор», у подъезда стоит «Лада». Прямое указание проиграло статистике: чем сильнее деталь спорит со средним кадром по теме, тем выше шанс, что её перепишут под привычное.

Предмет, которого почти нет в фотобанке: рама для ковров

Рама — самый локальный пункт списка. Пять моделей нарисовали узнаваемую конструкцию: сваренные буквой «А» или вкопанные П-образные трубы, на них перекинут ковёр. У FLUX.2 Max рама вышла спорной — гнутая хромированная труба, ближе к раме, чем к сушилке, но не та вкопанная конструкция, о которой шла речь. Засчитали с оговоркой, чтобы счёт можно было пересчитать самостоятельно.

А Qwen 2, у которой двор получился самым достоверным, повесила ковёр на складную бельевую сушилку — ту самую алюминиевую, что стоит на балконе у половины страны. Рядом она пририсовала синюю пластиковую штуку, похожую на выбивалку: про сам ритуал выбивания ковра модель что-то знает, а предмет подставила из соседней категории — «на этом сушат» вместо «по этому бьют».

Нейросеть Qwen 2 нарисовала двор по описанию: ковёр на бельевой сушилке вместо рамы, бабушка на лавочке и «Жигули»
Qwen 2 (Alibaba). Самый достоверный двор из шести — и единственный ковёр, повешенный на бельевую сушилку вместо рамы.

Разница между двумя провалами важнее, чем кажется. Иномарку модель заменила потому, что «знала» правильный ответ лучше автора запроса. Раму — потому что не знала вообще и подставила ближайший похожий объект. Со стороны оба случая выглядят одинаково: аккуратная картинка, ноль сомнений.

Числа модель не считает: пять этажей

Единственный пункт, который проверяется арифметикой, не взял никто.

Дом целиком, с крышей, влез в кадр у одной модели — Seedream v4. Этажей в нём четыре. У остальных пяти дом обрезан по верхней границе кадра: считать нечего, но и пяти этажей не видно ни на одной картинке. Честная формулировка — «ноль из шести подтверждённых», а не «все нарисовали четыре»: пять моделей просто увели крышу за край.

Нейросеть Seedream v4 нарисовала двор по описанию: четырёхэтажный дом, ковёр на раме, голубые «Жигули» и палец в углу кадра
Seedream v4 (ByteDance). Единственный дом, влезший в кадр целиком, — четыре этажа. А просьбу «снято на телефон» модель поняла буквально и дорисовала палец на объективе.

Ничего удивительного, если помнить, как это устроено: модель не считает этажи, она рисует дом, похожий на дом из таких кадров. Числительное для неё — не количество, а описание настроения. «Пятиэтажка» означает примерно «невысокий советский жилой дом», и в этом смысле все шесть справились. Вывод для любого, кто заказывает картинку с числом: цифру придётся проверять глазами. Пять яблок, три окна, четыре человека за столом — то же самое.

Чего никто не заказывал: палец на объективе и нечитаемый номер

Самое занятное в тесте — не провалы, а инициатива.

Seedream v4 поняла «снято на телефон» буквально и добавила в угол кадра смазанный палец, наползающий на объектив. Приём снимает недоверие лучше любого зерна: так выглядит половина фотографий в любой галерее.

Grok Imagine выдал машине российский номерной знак — правильного формата, с рамкой, на нужном месте. Написана на нём кириллическая абракадабра, которая не читается вообще. Текст в кадре в этом тесте специально не заказывали, так что это побочная находка, а не измеренный результат; как ведёт себя надпись, когда её просят прямо, мы разбирали в отдельном материале про русский текст на картинке.

Заодно Grok поставил у лавочки детский трёхколёсный велосипед и самокат, Nano Banana Pro — песочницу с пластиковыми игрушками, GPT Image 2 — граффити на стене подъезда и решётки на окнах первого этажа. Ничего из этого в запросе не было, и всё это ровно то, что действительно валяется в таких дворах.

Нейросеть Grok Imagine нарисовала двор по описанию: облезлая хрущёвка, бабушка у подъезда, ковёр на раме и зелёный Volkswagen
Grok Imagine, картинки у нейросети Grok. Вторая иномарка теста — Volkswagen Passat. Номер на ней написан нечитаемой кириллицей.

Получается забавное: там, где модель добавляет от себя, она попадает точнее, чем там, где выполняет прямое указание. Отсебятина берётся из того же массива кадров, что и всё остальное, — а массив про наши дворы знает много верного. Кроме того, что в нём никогда не стоит иномарка.

Как создать картинку ИИ по описанию и получить задуманное

Прогон был один, и выводов из него ровно четыре — зато все проверяемые на своём запросе.

Типичное можно считать уже заказанным. Лавочку, бельё и пожилую женщину описывать было незачем: они появились бы всё равно. Текст запроса стоит тратить не на очевидное, а на то, что от очевидного отличается.

Деталь, которая спорит с ожиданием, называют дважды и по-разному. «Старая иномарка» проиграла четыре раза из шести. «Старая иномарка, немецкая или японская, не отечественная» — это уже прямое исключение, а не пожелание. Чем дальше деталь от среднего кадра по теме, тем настойчивее её приходится повторять.

Числа и надписи не заказывают, а проверяют. Этажи, количество предметов, текст на вывеске и на номере — модель рисует их как узор, а не как информацию. Если картинка идёт в дело, в презентацию или в карточку товара, каждую цифру и каждую букву в кадре надо смотреть глазами.

И последнее: готовый кадр стоит пройти по собственному запросу, как по чек-листу. Мы разложили шесть картинок и проверили пять пунктов подряд — расхождения нашлись у всех шести, хотя с первого взгляда все шесть выглядят нормально. Общее ощущение «похоже» — плохой критерий: оно как раз и собрано из того типичного, которое модель дорисовала сама.

Нейросеть FLUX.2 Max нарисовала двор по описанию: облезлый подъезд, ковёр на гнутой раме, бабушка на зелёной лавке и «Жигули»
FLUX.2 Max — старшая модель FLUX. Самое похожее на телефонное фото: облезлая штукатурка, трещины в асфальте, объявления на двери подъезда. Машина снова отечественная.

Отсюда же следует практическая мелочь: одна и та же формулировка у разных моделей даёт разный результат, поэтому один прогон ничего не доказывает. Если деталь важна, её судьбу проще проверить, прогнав описание по нескольким моделям и сравнив кадры. В Veruna AI все шесть участников теста и остальные модели лежат в одном окне и переключаются в одном чате — без VPN, оплата рублями. А если сломалось одно место из десяти, чинить его дешевле правкой готового кадра: это задача ИИ-фоторедактора, а не новой генерации с нуля, где вместе с исправленной деталью поедет и вся остальная сцена.

Что в итоге

Модель работает не как фотограф, а как составитель фоторобота. Ей описывают приметы, она собирает лицо из самых частых черт: нос как у большинства, глаза как у большинства. Получается похоже — и одновременно ни на кого конкретно. Скажешь «нос с горбинкой» — учтёт, если горбинка не спорит с типовым лицом; заспорит — тихо усреднит.

Ни один из шести дворов не выглядит подделкой. Каждый выглядит как чей-то реальный двор — просто не как тот, который описывали в запросе.