Скриншот — самый простой случай для распознавания: ровный кадр, идеальный свет, чёткие буквы. Сложность здесь не в качестве, а в структуре: на экране обычно не текст, а интерфейс — меню, кнопки, таблицы, переписка. Порядок чтения у них не сверху вниз, и результат зависит от того, как поставлена задача.
Соберите формулировку задачи: что на снимке, что нужно получить, на каком языке. Готовый текст можно скопировать или открыть уже подставленным в приложении.
Формулировка собирается прямо в браузере и годится для любой модели с распознаванием картинок. Сам файл здесь не обрабатывается: снимок вы прикладываете уже в приложении.
Здесь важно сохранить, кто что сказал. Стоит прямо попросить вернуть текст диалогом: «имя — реплика».
Строки и столбцы нужно называть явно, иначе получится лента слов, где непонятно, к чему относится число.
Тут ценны точные коды и пути. Их надо сверять посимвольно: именно в них ошибка распознавания вреднее всего.
Обычная ситуация с защищёнными просмотрщиками. Работает, но помните про права на сам документ.
Скриншот показывает только видимую часть, а нужен обычно весь текст. Снимать по кускам и склеивать — рабочий, но неудобный путь: на стыках теряются строки.
Надёжнее либо снимать страницу целиком средствами браузера, либо сохранять её в PDF и работать уже с файлом — тогда текст идёт подряд и порядок не рвётся.
Потому что нет перекоса, теней и бликов — трёх главных причин ошибок. Экран даёт идеально ровный кадр.
Просить вернуть результат диалогом, с указанием говорящего. Иначе реплики склеятся в сплошной текст и станет непонятно, кто что сказал.
Со стоп-кадра — да, это тот же скриншот. Для субтитров во всём ролике нужен другой инструмент: распознавание кадр за кадром.
Значки интерфейса обычно пропускаются, эмодзи распознаются неровно. Если они важны, это стоит оговорить в задании.
Ровное фото читают все. Разница между инструментами видна только там, где кадр кривой, свет неровный, а текст в две колонки.
Разобрать снимок →