Как перевести текст с фотографии: Яндекс, Google, телефон или нейросеть

Чем переводить текст с фотографии: Яндекс, Google, камера телефона или нейросеть. Где чья сильная сторона, где перевод врёт и как снять фото, чтобы он не поплыл.

Тексты и копирайтинг
Как перевести текст с фотографии: Яндекс, Google, телефон или нейросеть — иллюстрация к статье
10 мин чтения

1

Коротко

  • Перевод «навёл камеру — увидел русский поверх вывески» умеют Google Translate и приложение «Яндекс». Это их территория, и в поездке им нет замены.
  • Без интернета работают тоже только они, если заранее скачать языковой пакет.
  • Короткую надпись со снимка в галерее переводит сам телефон, ставить ничего не надо: «Живой текст» на iPhone, «Объектив» на Android.
  • Когда текст длинный или непонятный по существу — инструкция, состав, договор, — пословный перевод рассыпается. Здесь выигрывает нейросеть: она читает снимок целиком и объясняет содержание.

Задача «прочитать, что написано на этой фотографии» решается четырьмя разными способами, и универсального победителя среди них нет. Камера Google и Яндекса выигрывает на улице, встроенные средства телефона — на скриншотах и снимках из галереи, нейросеть — на длинном и сложном тексте. Разница между ними не в качестве движка, а в том, какой вопрос вы задаёте: «что тут написано» или «что это вообще значит».

Яндекс Переводчик: два разных инструмента под одним именем

Под одним названием живут две непохожие функции, и разочарование чаще всего наступает у того, кто попал не в ту.

Веб-версия: на translate.yandex.ru есть вкладка «Картинки». Перетаскиваете файл, сервис распознаёт надписи и показывает перевод поверх изображения, а распознанный текст можно перенести в обычное окно переводчика и доработать руками. Это работа с готовым снимком, камеры здесь нет — порядок действий описан в справке Яндекса.

«Умная камера» — это уже другое: она живёт в мобильном приложении «Яндекс», а не в отдельном приложении переводчика. Наводите телефон на вывеску, объявление или дорожный указатель, и перевод отображается прямо поверх оригинала. Именно её обычно и ищут те, кто гуглит «яндекс сканер» или «яндекс скан», — отдельного продукта с таким названием у Яндекса нет.

Выигрывает Яндекс скоростью и тем, что приложение уже стоит в телефоне у большинства. Проигрывает на длинном тексте: перевод остаётся пословным. Для вывески этого достаточно, для инструкции или договора начинает сыпаться. В сравнительном тесте Рамблера Яндекс не справился с иероглифами на японской упаковке и выдал бессмыслицу, хотя английский и испанский отработал прилично.

Google Translate: камера в реальном времени и офлайн

У Google фото-перевод устроен проще: одна кнопка камеры, дальше выбор — снимать в реальном времени или взять готовое изображение из галереи. Перевод так же ложится поверх картинки, поэтому сразу видно, какая надпись во что превратилась. Оба режима описаны в справке Google.

Две вещи, которых почти ни у кого больше нет.

Офлайн. Если заранее скачать языковой пакет, перевод работает без интернета — в чужой стране без роуминга это решающий аргумент, и никакой веб-сервис его не перебьёт.

Реальное время. Камеру не нужно даже нажимать: держите телефон над меню и читаете русский текст, пока ведёте объектив по строчкам.

Ограничения ровно те же, что у Яндекса. Это переводчик надписей: он покажет русский текст, но не объяснит, что означает пункт в инструкции, не выделит аллергены в составе и не расшифрует аббревиатуру в медицинской выписке. Такой задачи перед ним и не ставили.

Что умеет сам телефон: «Живой текст» и «Объектив»

Класс инструментов, про который чаще всего забывают: ставить ничего не нужно, всё уже есть.

На iPhone текст на фотографии выделяется прямо в приложении «Фото» — функция называется «Живой текст». Ведёте пальцем по надписи как по обычному тексту, и в контекстном меню появляются «Скопировать» и «Перевести». Это же и ответ на вопрос «как скопировать текст с фото на айфоне», который люди задают отдельно от перевода: копирование и перевод здесь соседние пункты одного меню.

На Android ту же роль играет «Объектив» (Google Lens). Он встроен в камеру, в Google Фото и в поиск: выделяете текст на снимке, получаете перевод или копию.

За это не надо ничего ставить и никуда переходить, и на скриншотах, где шрифт идеально ровный, встроенные средства работают отлично. Проблема начинается на плотном тексте в несколько колонок: там важен порядок чтения, и его они восстанавливают неуверенно, выдавая обрывки.

Нейросеть: когда нужен не перевод слов, а понимание текста

Четвёртый способ устроен иначе. Нейросеть читает снимок целиком, как документ, и отвечает текстом в чат, а не подставляет перевод под каждое слово на картинке.

Разница видна там, где пословный перевод даёт кашу.

  • Длинный связный текст. Страница учебника, письмо, договор. Модель держит контекст всего абзаца, поэтому многозначное слово переводит по смыслу документа: charge в инструкции к технике — «зарядка», а в банковском счёте — «списание».
  • Непонятные реалии и сокращения. Аббревиатура в выписке, номер стандарта на упаковке, пометка инспектора в японском аукционном листе. Можно не только перевести, но и спросить, что это вообще значит.
  • Сложный кадр. Часть текста в тени, снято под углом, шрифт с завитушками. Здесь важнее не аккуратность распознавания, а способность достроить смысл по контексту.
  • Вопросы по тому же снимку. «Выпиши только состав», «назови итоговую сумму и срок оплаты», «перескажи в двух предложениях». Фотография остаётся в переписке, загружать её заново не нужно.

Так устроен перевод по фото в Veruna: вы прикладываете фотографию, скриншот или картинку, ассистент сам определяет язык оригинала и возвращает русский перевод текстом. Veruna — общий вход к сотне с лишним нейросетей в одном окне, поэтому если один снимок распознался неуверенно, есть смысл переключить модель и отправить его ещё раз: на мелком шрифте и иероглифах разница между моделями бывает заметной.

И сразу честно про то, чего у этого способа нет. Камеры в реальном времени — нет, только загрузка готового снимка. Офлайна — нет, нужен интернет. Перевод не накладывается поверх картинки и не сохраняет вёрстку оригинала: на выходе обычный текст, который вы копируете. Если задача звучит как «навёл на вывеску и пошёл дальше», это не сюда — это к Google или Яндексу.

Что выбрать под конкретную задачу

  • Вывеска, указатель, ценник в поездке — камера Google Translate или приложения «Яндекс». Скорость здесь важнее литературности.
  • Нет интернета — только офлайн-режим мобильных приложений, и пакет надо скачать заранее, дома.
  • Скриншот переписки, короткая надпись на снимке из галереи — встроенные средства телефона, это быстрее всего остального.
  • Инструкция, состав, договор, выписка, страница учебника — нейросеть: нужен смысл целиком, а подстрочник его как раз и ломает.
  • Текст можно выделить и скопировать — не мучайте камеру. Вставьте его в обычный текстовый переводчик: с английского на русский или с русского на английский. Перевод текста всегда точнее перевода снимка, потому что этап чтения изображения просто исчезает, а с ним и шанс ошибиться.

Как снять фото, чтобы перевод не поплыл

Кадр влияет на результат сильнее, чем выбор сервиса, и претензия «переводчик по фото врёт» часто оказывается претензией к снимку. Правила ниже одинаковы для всех четырёх инструментов.

  1. Держите камеру параллельно странице. Съёмка под углом искажает буквы, строки начинают наезжать друг на друга, и дальше уже неважно, чей движок их читает.
  2. Свет — за спиной, вспышку на глянце не включайте. Блик от лампы на упаковке съедает целую строку, а восстанавливать её нечем.
  3. Подойдите ближе вместо зума. Цифровой зум телефона просто растягивает пиксели: буквы становятся крупнее, но не чётче.
  4. Снимайте по одному блоку текста. Длинную инструкцию лучше прислать двумя-тремя кадрами, чем одним общим планом, где шрифт превращается в рябь.

Проверка перед отправкой простая: если вы сами не различаете символы на снимке, инструмент их тоже не различит. Ни один из четырёх не додумывает недостающее — они либо читают, либо выдают правдоподобную ерунду, и второе опаснее.

Почему меню и составы переводятся хуже всего

Два самых частых сюжета фото-перевода — меню в ресторане и состав на упаковке — одновременно и два самых ненадёжных. Причины у них разные.

В меню почти нет предложений. Есть строчки из двух-трёх слов без глаголов и без контекста: «flan», «tartare», «pide». Переводчику не за что зацепиться, поэтому он подставляет ближайшее словарное значение. В том же тесте Рамблера испанский flan превратился в «заварной крем» — формально не ложь, но принесут вам не то, что вы представили. Названия национальных блюд в принципе не переводятся: у них нет русского эквивалента, есть только описание, а описание пословный переводчик давать не умеет.

В составе всё держится на терминах: названия консервантов, добавки с индексом E, латинские названия растений, аллергены. Пословный перевод легко заменяет конкретное вещество бытовым словом — и вы теряете ровно ту информацию, ради которой фотографировали упаковку. Добавьте мелкий шрифт на изогнутой глянцевой поверхности, и получите худшие условия съёмки из возможных.

Работает другой подход: спрашивать по существу вместо того, чтобы переводить состав целиком. «Есть ли здесь орехи, лактоза, глютен», «что из этого списка консерванты», «какая дозировка». Задать такой вопрос можно только нейросети: камера-переводчик показывает перевод, но диалога не ведёт.

Отдельно про ответственность. Если по переводу вы принимаете решение с последствиями — дозировка лекарства, пункт договора, срок оплаты, — цифры и термины перепроверяйте глазами независимо от инструмента. А для официального применения, где документ подают в организацию, годится только заверенный перевод от аккредитованного переводчика: машинный не подходит ни в каком виде, и узнать это лучше заранее.

Иероглифы и вертикальное письмо: отдельная история

Китайский, японский и корейский — тот случай, когда фотография остаётся единственным входом. Иероглиф нельзя набрать на клавиатуре, не зная языка, поэтому снимок и есть способ задать вопрос. И это же самый тяжёлый материал для распознавания.

Первое, что ломается, — порядок чтения. Японский текст нередко идёт сверху вниз и справа налево, а инструменты, обученные на горизонтальных строках, путают колонки местами. Перевод в итоге склеивается из кусков разных предложений. Помогает прямое указание «текст идёт сверху вниз», но сказать его можно только нейросети: у камеры-переводчика нет места, куда такую подсказку вписать.

Второе — плотность. Один знак несёт столько же смысла, сколько целое слово, поэтому мелкий шрифт критичнее, чем в латинице: потеря одного символа меняет фразу целиком. И третье: близкие иероглифы отличаются парой черт, на смазанном кадре они схлопываются в один, а ошибка получается не заметной глазу, зато смысловой.

Отсюда практика: снимайте крупнее, чем кажется нужным, по одному фрагменту, и на важном решении сверяйте два инструмента, а не доверяйте первому результату. Иногда нужен вообще не перевод, а разбор. Японский аукционный лист, например, читают ради оценок кузова и салона, пробега и пометок инспектора, и полезнее попросить расшифровать его по пунктам, чем получить гладкий пересказ.

Частые вопросы

Какой переводчик по фото точнее — Яндекс или Google? Единого победителя нет, результат зависит от языка и от качества снимка. В сравнительном тесте Рамблера первое место занял Google Translate, Яндекс — второе, причём на японской упаковке Яндекс не справился, а на европейских языках отработал наравне. Практический вывод скучнее любого рейтинга: на плохом кадре ошибутся оба, на хорошем оба справятся, и разница между ними будет меньше, чем разница между удачной и неудачной фотографией.

Можно ли перевести текст с фото без интернета? Да, но только через мобильные приложения Google Translate и Яндекса, и языковой пакет нужно скачать заранее, пока связь есть. Веб-сервисы и нейросети офлайн не работают в принципе: обработка идёт на сервере. Если едете туда, где с интернетом плохо, качайте пакеты дома — на месте будет поздно.

Как перевести текст с фотографии на компьютере, а не на телефоне? Через браузер. У Яндекс Переводчика есть вкладка «Картинки» с загрузкой файла, у Google Translate — свой раздел для изображений, нейросети принимают снимок вложением прямо в чат. Камера при этом не нужна: подойдёт скриншот, скан или картинка, скачанная из интернета. Скриншот часто даёт результат даже лучше фотографии — на нём нет ни бликов, ни перспективы, ни смазанных букв.

Что делать, если на снимке рукописный текст? Готовьтесь к тому, что это самый сложный случай для любого инструмента: печатный шрифт читается уверенно, почерк — нет, и чем он индивидуальнее, тем ниже шанс. Камеры-переводчики на рукописном обычно пасуют совсем. Снимайте крупно и по одной строке, а цифры, даты и суммы перепроверяйте вручную — ошибка в одном знаке здесь стоит дороже, чем весь перевод.

Как перевести текст с фотографии: Яндекс, Google, телефон или нейросеть — Veruna AI