Флаг Норвегии

Ответ по картинке: как работает поиск по изображению

Сфотографировать задачу и получить готовый ответ сегодня так же привычно, как набрать вопрос текстом, но работают эти два способа совсем по-разному. Поиск по картинке сначала «расшифровывает» изображение с помощью компьютерного зрения и OCR, а уже потом ищет решение — и на каждом из этих этапов может закрасться ошибка. В статье разберём, чем такой запрос отличается от привычного текстового поиска, как мультимодальные модели связывают фото со смыслом и в каких ситуациях камера смартфона оказывается быстрее клавиатуры.

Что такое поиск по картинке и как он работает

Что такое поиск по картинке и как он работает

Поиск по картинке — это технология, которая принимает на входе не текстовый запрос, а изображение (фото, скриншот или загруженный файл), а на выходе выдаёт релевантный ответ: похожие картинки, название объекта, готовое решение задачи или ссылки на источники. В отличие от привычной строки поиска, здесь система сначала должна «понять», что изображено на снимке, и только потом искать информацию.

Технически процесс строится на превращении визуальных данных в понятный компьютеру формат. Любая фотография сначала проходит предобработку: нормализуется размер, освещённость, ориентация и цветовое пространство, чтобы убрать шум и искажения, которые могли бы помешать распознаванию. После этого нейросеть выделяет ключевые визуальные признаки — линии, контуры, текстуры, цветовые переходы — и на их основе строит эмбеддинг: числовой вектор, который компактно описывает содержание изображения.

Эмбеддинг
Векторное представление изображения или текста в виде набора чисел, где схожие по смыслу объекты оказываются «близко» друг к другу в математическом пространстве.

Дальше в игру вступает поиск по ближайшим соседям: система сравнивает полученный вектор с миллионами уже проиндексированных эмбеддингов в базе данных, используя меру схожести — чаще всего косинусное расстояние. Чем ближе векторы, тем выше вероятность, что изображения связаны по смыслу или визуально похожи. Именно так работают сервисы вроде Google Lens и Яндекс Картинок, которые ежедневно обрабатывают огромные объёмы визуального контента.

Весь путь от снимка до ответа обычно укладывается в несколько последовательных этапов:

  1. Предобработка — нормализация размера, цвета и ориентации кадра.
  2. Извлечение признаков — нейросеть находит формы, объекты и текстуры.
  3. Генерация эмбеддинга — визуальные данные превращаются в вектор чисел.
  4. Сравнение с индексом — вектор сопоставляется с базой данных похожих изображений.
  5. Ранжирование и выдача результата — система показывает наиболее релевантные совпадения.
Точность поиска по фото определяется ещё до того, как пользователь нажимает кнопку: конвейер обработки изображения независимо от платформы — Google Lens, Яндекс Картинки или TinEye — включает предобработку, извлечение признаков, сравнение с индексом и ранжирование результатов.

Важно понимать, что «поиск по картинке» и «распознавание объекта» — не одно и то же: первое находит визуально или семантически похожие изображения, второе — определяет, что конкретно изображено. Современные сервисы обычно совмещают оба подхода, чтобы дать пользователю максимально полезный ответ.

Компьютерное зрение и распознавание объектов

Компьютерное зрение — это область искусственного интеллекта, которая учит машины «видеть» изображение так, как это делает человек: выделять объекты, границы, текстуры и понимать, что происходит на кадре. Основным инструментом здесь долгое время были свёрточные нейронные сети (CNN) — архитектуры, которые обрабатывают картинку слоями, постепенно переходя от простых деталей к сложным образам.

Работает это как последовательное «сканирование» изображения небольшим фильтром, или ядром свёртки. На первом слое сеть находит самые простые элементы — вертикальные и горизонтальные линии, перепады яркости, цветовые границы. Каждый следующий слой берёт эти простые признаки и комбинирует их во всё более сложные паттерны: сначала углы и текстуры, затем части объектов — например, колесо или ухо животного, — и только в конце сеть распознаёт целый объект целиком.

Карта признаков (feature map)
Промежуточное представление изображения, которое показывает, где и насколько сильно сработал определённый фильтр — например, обнаружил ли он границу объекта в этой точке кадра.

В последние годы наряду с CNN всё активнее применяются Vision Transformer (ViT) — архитектуры, заимствованные из обработки текста. В отличие от свёрточных сетей, которые анализируют изображение локально, фрагмент за фрагментом, трансформер сразу охватывает всю картинку целиком и выстраивает связи между удалёнными друг от друга участками через механизм внимания. Это особенно полезно, когда для распознавания важен широкий контекст — например, чтобы отличить силуэт человека на фоне толпы.

На выходе система распознавания объектов обычно решает одну из нескольких задач:

  • классификация — определить, что в целом изображено на кадре;
  • детекция объектов — найти и обвести рамкой конкретные предметы на фото;
  • сегментация — выделить точные контуры каждого объекта, вплоть до пикселя.
Свёрточные сети автоматизируют то, что раньше инженеры делали вручную: подбор фильтров и комбинирование найденных простых признаков в более сложные — от линий и текстур до целостного образа объекта.

Именно эта многоступенчатая обработка объясняет, почему поиск по фото иногда «путает» похожие объекты — например, кота и рысь: чем более абстрактным становится признак на последних слоях сети, тем выше риск, что визуально схожие, но разные по сути предметы получат близкие оценки.

Извлечение текста с изображения (OCR)

Извлечение текста с изображения (OCR)

Когда на фотографии есть не объект, а текст — условие задачи из учебника, вывеска на другом языке или таблица из отчёта, — в дело вступает другая технология: OCR (Optical Character Recognition, оптическое распознавание символов). Её задача — превратить изображение букв и цифр в машиночитаемый, редактируемый текст, который потом можно скопировать, перевести или отправить в поисковый движок.

Классический пайплайн OCR состоит из нескольких последовательных шагов, и от качества каждого зависит итоговый результат:

  1. Предобработка — изображение выравнивается, убирается шум и тени, повышается контраст между буквами и фоном.
  2. Сегментация — алгоритм определяет, где на кадре находятся строки, слова и отдельные символы, отделяя текст от рисунков и пустых областей.
  3. Распознавание — каждый выделенный символ сопоставляется с эталоном или анализируется нейросетью, которая определяет конкретную букву или цифру.
  4. Постобработка — результат сверяется со словарём и грамматикой языка, что помогает исправить типичные ошибки распознавания, вроде путаницы «rn» и «m».
OCR (Optical Character Recognition)
Технология компьютерного зрения, которая обнаруживает текст на изображении и преобразует его в цифровой, доступный для поиска и редактирования формат.

Современные системы, в отличие от ранних алгоритмов сопоставления шаблонов, всё чаще опираются на нейросети, которые учитывают контекст целого слова или предложения — это заметно повышает точность на неидеальных фотографиях со смазом, бликами или неровным освещением.

Тип текста Типичная точность OCR
Печатный текст 95–99%
Рукописный текст (латиница) 60–85%
Рукописный текст на русском языке 65–75%
Математические формулы и смешанные символы 70–85% и ниже
По данным исследований, точность современных OCR-систем на печатном тексте достигает 98–99%, но на рукописных формулах и смешанных математических выражениях падает до 70–85%, а на рукописном русском тексте — до 65–75%.

Именно поэтому фотография страницы учебника с аккуратным типографским шрифтом распознаётся почти безошибочно, а снимок тетради с формулами от руки может дать OCR-движку сразу несколько вариантов «прочтения» одного и того же символа — отсюда и берутся забавные, а иногда критичные ошибки в автоматических ответах по фото.

Принцип работы текстового поиска и генерации ответа

Классический текстовый поиск строится на трёх последовательных этапах: сканирование (краулинг), индексация и ранжирование. Роботы поисковой системы обходят миллиарды страниц, сохраняют их содержимое в базу, а когда пользователь вводит запрос, движок за доли секунды подбирает наиболее релевантные документы и выстраивает их по сотням факторов — от совпадения ключевых слов до поведенческих сигналов.

В современных системах, включая ИИ-ассистентов, этот процесс усложнился благодаря архитектуре RAG (Retrieval-Augmented Generation — генерация с дополненной выборкой). Она разделяет ответ на вопрос на два этапа: сначала система находит релевантную информацию, а затем языковая модель формирует связный текст на её основе, а не полагается только на «память», заложенную при обучении.

RAG (Retrieval-Augmented Generation)
Подход, при котором большая языковая модель перед генерацией ответа получает дополнительный контекст из внешнего источника — базы документов, интернета или корпоративного архива, — что снижает риск фактических ошибок и «галлюцинаций».

Путь текстового запроса от ввода до готового ответа выглядит так:

  1. Запрос анализируется — система определяет ключевые слова, язык, регион и вероятное намерение пользователя.
  2. Текст преобразуется в вектор той же моделью эмбеддингов, что использовалась для индексации документов.
  3. Система ищет ближайшие по смыслу фрагменты в векторной базе, сравнивая запрос с проиндексированным контентом через косинусное сходство.
  4. Найденные фрагменты при необходимости переранжируются, чтобы наверх поднялись самые точные совпадения.
  5. Языковая модель формирует финальный ответ, опираясь на извлечённый контекст, и нередко добавляет ссылки на источники.
Сравнение в поисковых системах на основе эмбеддингов идёт не по буквальному совпадению слов, а по близости смысла: фрагмент «как снизить отток клиентов» может подойти под запрос «почему уходят пользователи», хотя общих слов между ними нет.

Ключевое отличие такого поиска от простого перебора страниц — понимание намерения, а не только формы запроса. Именно поэтому современные текстовые системы одинаково хорошо реагируют на прямой вопрос, разговорную формулировку и даже опечатки: механизм эмбеддингов сглаживает разницу в словах, если смысл запроса остаётся понятным.

Ключевые отличия визуального и текстового запроса

Ключевые отличия визуального и текстового запроса

На первый взгляд разница кажется чисто технической: в одном случае пользователь печатает слова, в другом — загружает файл. На деле механизмы обработки запроса расходятся гораздо глубже, потому что текстовый запрос и визуальный запрос несут принципиально разный объём и тип информации на входе.

Слово или фраза — это уже готовая абстракция, которую человек сформулировал сам, отфильтровав лишнее. Фотография или скриншот, напротив, содержит избыточные данные: фон, освещение, посторонние объекты, ракурс — и системе приходится самостоятельно решать, что из этого важно, а что нет. Именно поэтому «Яндекс» отдельно отмечает: с 2025 года алгоритм поиска по картинкам анализирует фото и текст на странице вместе, а не по отдельности, и при расхождении данных приоритет получает именно изображение, а не подпись к нему.

По данным исследования «Яндекса», 56% онлайн-покупателей признаются, что совершают импульсивные покупки «по картинке», а 55% пользователей хотя бы раз искали товар по фото или скриншоту.

Формат входных данных и способ формулировки

Текстовый запрос требует от человека перевести мысль в слова — назвать цвет, форму, бренд, материал. Это удобно для абстрактных или уникальных понятий («рецепт борща без мяса»), но крайне неудобно для сложных визуальных характеристик, которые трудно описать точно.

  • Текст — компактный, но требует усилий на формулировку и знания терминологии.
  • Изображение — избыточное по данным, но не требует подбора слов, достаточно навести камеру.
  • Комбинированный запрос (фото + уточняющая фраза) объединяет оба преимущества и всё чаще используется в мультимодальных сервисах.

Что именно ищет система

При текстовом поиске движок сопоставляет запрос с индексом слов и их связей — работает классическая логика ранжирования по ключевым словам и семантике. При визуальном поиске система сначала переводит картинку в набор чисел — эмбеддинг, — а затем ищет ближайшие по смыслу эмбеддинги среди миллионов других изображений или товарных карточек.

Эмбеддинг
Числовое представление объекта (текста, картинки, звука), которое отражает его смысловые признаки и позволяет сравнивать разнородные объекты между собой по степени похожести.

Это отличие определяет и разное поведение выдачи. Текстовый поиск может уточнять результат по мере ввода символов, подсказывая варианты запроса. Визуальный поиск такой «живой» подсказки лишён — скорректировать намерение на лету сложнее, зато результат сразу нагляден: пользователь видит похожие изображения и может визуально оценить релевантность, не открывая десятки сайтов.

Параметр Текстовый запрос Визуальный запрос
Формат ввода Слова, фразы Фото, скриншот, кадр с камеры
Основной механизм Сопоставление ключевых слов и семантики Сравнение эмбеддингов изображений
Гибкость коррекции запроса Высокая — можно уточнять по ходу ввода Низкая — нужна новая фотография или подсказка текстом
Скорость оценки результата Требует чтения сниппетов Мгновенная визуальная проверка совпадения
Лучше подходит для Абстрактных понятий, точных формулировок Неизвестных объектов, товаров «как на фото»

Ещё одно отличие — в поведении пользователя после получения ответа. По статистике «Яндекса» ещё в 2010 году пользователь поиска по картинкам в среднем просматривал 12 страниц выдачи, тогда как в обычном веб-поиске люди чаще ограничивались первой страницей результатов. Это косвенно показывает, что визуальный поиск изначально задумывался и воспринимается как исследовательский инструмент, а не как способ получить один точный ответ.

Почему визуальным запросом сложнее управлять Текст можно переформулировать словами — заменить синоним, добавить уточнение, убрать лишнее слово. Изображение изменить так же гибко нельзя: если система «зацепилась» не за тот объект в кадре (например, за фон вместо основного предмета), пользователю проще сделать новое фото или обрезать старое, чем «объяснить» алгоритму ошибку текстом. Поэтому многие сервисы совмещают фото с текстовой подсказкой — так называемый мультимодальный запрос, который отчасти компенсирует эту негибкость.

Разница в интерпретации намерения пользователя

Когда человек вводит текстовый запрос, поисковая система работает с готовой формулировкой цели: слова уже несут в себе часть смысла, и алгоритму остаётся сопоставить их с накопленной статистикой поведения похожих пользователей. При визуальном запросе всё наоборот — фотография сама по себе цели не объясняет, и системе приходится реконструировать намерение по косвенным признакам: что в кадре главное, а что случайный фон.

Из-за этого модель распознавания вынуждена сначала выделить так называемый фокус внимания — конкретный объект или область на снимке, к которому, по её предположению, относится запрос пользователя. Здесь возможна ошибка на самом старте: если человек сфотографировал кроссовки на фоне яркого ковра, система может «зацепиться» за узор ковра вместо самой обуви.

Google запатентовал механизм, который распознаёт в текстовом запросе слова с «визуальным намерением» — например, описание цвета, узора или стиля — и предлагает пользователю заменить их фотографией, поскольку словами такие детали передаются с потерей точности (loss of fidelity).

Разница проявляется и в том, какие сигналы система использует для уточнения смысла. Текстовый поиск опирается на историю запросов, географию и клики по похожим формулировкам. Визуальный — на анализ самого изображения плюс сопутствующий контекст: если запрос пришёл со скриншота экрана, отдельно распознаётся окружающий текст (OCR), чтобы понять, к какому именно элементу на картинке относится вопрос пользователя.

  • Текстовый запрос — намерение выражено словами напрямую, задача системы — расшифровать смысл фразы.
  • Визуальный запрос без подписи — намерение приходится домысливать по объекту в фокусе кадра.
  • Визуальный запрос с уточняющим текстом (мультимодальный) — система совмещает буквальный смысл слов с тем, что видит на фото, и получает более точную картину цели.
Фокус внимания (visual focus)
Область изображения, которую алгоритм компьютерного зрения определяет как наиболее вероятный объект интереса пользователя, отделяя его от фона и второстепенных деталей.

Именно поэтому голосовые и визуальные помощники — от «Алисы» до зарубежных аналогов — всё чаще анализируют не только сам кадр, но и произнесённую рядом фразу вроде «что это?»: одна картинка без слов допускает слишком много трактовок, а пара «слово плюс изображение» сужает пространство возможных ответов почти до одного.

Что происходит, если система не уверена в намерении Когда визуальный анализ не даёт однозначного фокуса — например, на фото сразу несколько похожих по значимости объектов — сервис обычно не пытается угадать единственный правильный ответ. Вместо этого он показывает несколько альтернативных интерпретаций (похожие товары, похожие места, похожие лица) и предлагает пользователю самому выбрать нужный вариант или уточнить запрос текстом.

Точность и неоднозначность результатов

Точность и неоднозначность результатов

У текстового и визуального поиска разная природа ошибок. Текстовый движок обычно ошибается в релевантности — подбирает не совсем то, что имел в виду пользователь, но редко «придумывает» несуществующие факты о самом запросе. Визуальный поиск и построенные на его основе мультимодальные ответы рискуют по-другому: система может уверенно назвать деталь, которой на фотографии попросту нет.

Это явление называют галлюцинацией — модель выдаёт правдоподобное, но не соответствующее реальному изображению утверждение. Причина в том, что при затруднении распознать объект нейросеть иногда опирается не на пиксели перед собой, а на «статистически привычную» картину мира из обучающих данных.

Галлюцинация мультимодальной модели
Ситуация, когда ИИ описывает объект, цвет, надпись или деталь сцены, которых фактически нет на изображении, либо связывает текст ответа с элементами, не относящимися к картинке.
Исследователи фиксируют, что визуальные галлюцинации проявляются в трёх формах: модель называет объект, которого нет на фото; описывает существующий объект неверно (например, путает цвет или взаимное расположение); либо формирует ответ, логически не связанный с содержимым снимка.

При этом сам по себе базовый слой компьютерного зрения — то есть распознавание объектов и классификация — стал заметно точнее за последние годы. Современные модели-детекторы достигают показателя mAP (средней точности обнаружения) в районе 55–56% на сложных открытых датасетах, а специализированные классификаторы вроде Vision Transformer показывают top-1 точность около 88% на эталонных наборах изображений. Проблема в другом: высокая точность распознавания «что за объект в кадре» не гарантирует такой же точности на следующем шаге — когда система должна связать найденный объект с правильным текстовым ответом или карточкой товара.

  • Ошибка идентификации — система путает похожие объекты (например, два похожих сорта комнатных растений).
  • Ошибка контекста — объект распознан верно, но неверно определена его роль в кадре (главный предмет vs фон).
  • Ошибка сопоставления — найдено похожее изображение, но связанные с ним данные (цена, название, местоположение) устарели или относятся к другому товару.

Текстовый запрос в этом смысле прозрачнее для проверки: пользователь легко видит, что результат не соответствует формулировке, и корректирует фразу. Проверить ошибку визуального поиска сложнее — нужно самому сравнить фотографию с выдачей, а не просто прочитать текст ответа.

Тип ошибки Текстовый поиск Визуальный / мультимодальный поиск
Наиболее частая проблема Низкая релевантность выдачи запросу Галлюцинация — выдуманная деталь или объект
Заметность ошибки для пользователя Высокая — легко сравнить с формулировкой Средняя/низкая — требует сверки с изображением
Способ коррекции Изменить формулировку запроса Сделать новое фото, добавить текстовую подсказку
Источник неоднозначности Многозначность слов и синонимов Сложность сцены, качество фото, ракурс, освещение
Как разработчики снижают риск галлюцинаций Один из практических подходов — «заземление» ответа: модель просят перечислять доказательства по каждому элементу отдельно (например, сосчитать объекты или явно назвать цвет), разрешают отвечать «не уверен» и требуют отмечать нечёткие или перекрытые участки изображения. Другой путь — жёстко ограничивать вывод генеративной модели результатами отдельного, узкоспециализированного детектора объектов, чтобы финальный текст не выходил за рамки того, что реально подтверждено анализом картинки.

Мультимодальные модели: как ИИ объединяет текст и изображение

Долгое время системы для работы с текстом и системы для работы с изображениями создавались отдельно: одна нейросеть умела читать, другая — «смотреть», а результаты их работы потом искусственно склеивались. Современный подход другой — мультимодальные модели (их также называют VLM, Visual Language Model) с самого начала обучены работать с разными типами данных одновременно, а не переключаться между отдельными пайплайнами.

Ключевая идея в том, что и слово, и картинка на входе превращаются в один и тот же тип данных — числовой вектор, или эмбеддинг. Изображение для этого разбивают на небольшие фрагменты, патчи, каждый из которых превращается в «визуальный токен» и обрабатывается моделью точно так же, как обрабатывается обычное слово в тексте.

Патч (patch)
Небольшой квадратный фрагмент изображения (например, 16?16 пикселей), который модель класса Vision Transformer превращает в отдельный числовой токен для дальнейшей совместной обработки с текстом.

Внутри такой архитектуры обычно работают три ключевых компонента: визуальный энкодер, который «читает» картинку и превращает её в токены, языковой блок, отвечающий за понимание и генерацию текста, и связывающий их проекционный слой — своего рода переводчик, без которого две части модели буквально «говорили бы на разных языках». Получив единую последовательность токенов, где часть — слова, а часть — фрагменты изображения, модель обрабатывает их совместно и формирует итоговый ответ.

  • Изображение и текст с самого начала попадают в общее векторное пространство, а не обрабатываются раздельно.
  • Модель может сопоставлять смысл слова и визуальный признак напрямую, без промежуточного «перевода» через отдельные системы.
  • Один и тот же движок способен и описать фото, и ответить на вопрос по нему, и найти похожие изображения — без переключения между разными сервисами.

Российский пример такого подхода — VLM, разработанная в «Яндексе» и используемая в Поиске по картинкам, «Умной камере», Нейро и Live-режиме голосового помощника «Алиса». В основе модели лежит связка из текстовой YandexGPT, визуального энкодера ViT и адаптера, соединяющего их в общее пространство.

По данным «Яндекса», их VLM в Live-режиме «Алисы» генерирует ответ пользователю в среднем за 3,5 секунды, из которых около 2 секунд занимает работа самого мультимодального пайплайна — от анализа кадра с камеры до формирования финального текста.

Важная деталь: у большинства современных мультимодальных ассистентов ответ формируется не «за один шаг». Сначала модель распознаёт объект и извлекает признаки с фото, затем отдельный компонент — рефразер — переформулирует расплывчатый вопрос пользователя (например, «Что кушает?») в конкретный поисковый запрос («Чем питается детёныш гренландского тюленя»), после чего система обращается за дополнительными данными в интернет и уже на их основе финальная модель-суммаризатор пишет ответ.

Компонент архитектуры Что делает
Визуальный энкодер Превращает изображение в набор токенов-эмбеддингов
Языковая модель Обрабатывает текстовые токены, понимает намерение запроса
Проекционный слой (адаптер) Приводит визуальные и текстовые токены к общему пространству представлений
Рефразер Формулирует поисковый запрос на основе распознанного изображения и вопроса пользователя
Суммаризатор Формирует финальный текстовый ответ с учётом найденной информации

Именно эта архитектура объясняет, почему мультимодальный ответ на фото часто ощущается «умнее» простого распознавания объекта: система не просто называет предмет в кадре, а фактически проводит короткое исследование — от изображения к смыслу, а от смысла — к проверенному ответу из внешних источников.

Как обучают такие модели на практике Разработчики отмечают, что качество мультимодальной модели заметно растёт не столько от объёма данных, сколько от их разнообразия и точной разметки: помогают «диалоги-дозапросы» про похожие объекты на разных фото, обучение на реальных пользовательских лайках и дизлайках из поисковых сервисов, а также отдельная стадия обучения с подкреплением, где асессоры выбирают лучший из нескольких вариантов ответа модели на одну и ту же картинку.

Как CLIP и похожие модели связывают картинку со смыслом

Как CLIP и похожие модели связывают картинку со смыслом

Чтобы компьютер вообще мог сравнивать текст и изображение, оба типа данных нужно привести к общему языку — числам. Слово можно закодировать номером в словаре, а картинку — таблицей яркостей пикселей, но такие «сырые» представления бесполезны для сравнения смысла: номера двух похожих по значению слов в словаре могут отличаться так же сильно, как номера двух совершенно разных слов. Проблему решает векторное представление — набор чисел фиксированной длины, который нейросеть учится генерировать так, чтобы близкие по смыслу объекты получали похожие наборы чисел.

Именно на этом принципе построена модель CLIP (Contrastive Language-Image Pre-training), разработанная OpenAI в 2021 году. Идея CLIP простая: изображение и его текстовое описание должны получать почти одинаковый вектор, а изображение и случайный, не подходящий по смыслу текст — заметно различающиеся векторы.

Косинусная близость
Математическая мера того, насколько похожи два вектора по направлению; чем ближе значение к единице, тем более схожи по смыслу объекты, которые эти векторы описывают.

Обучают модель методом contrastive learning — «обучения через противопоставление». Нейросети на вход подают пару «картинка плюс правильное описание» и рядом — то же изображение с заведомо неподходящим текстом (например, фото собаки с мячом и подпись «кошка с футбольным мячом»). Модель штрафуют всякий раз, когда вектор изображения оказывается ближе к неправильному описанию, чем к правильному, — и за миллионы таких примеров она постепенно учится безошибочно разделять смыслы.

  1. Модель получает пару «изображение — подпись» из размеченного набора данных.
  2. Отдельно вычисляется вектор для этого изображения и вектор для случайного, не подходящего к нему текста.
  3. Система сравнивает косинусную близость «изображение — верное описание» и «изображение — неверное описание».
  4. Если неверная пара оказалась ближе, чем верная, модель штрафуется через функцию ошибки и корректирует свои параметры.
  5. Процесс повторяется на огромном количестве пар, пока модель не начнёт устойчиво разделять подходящие и неподходящие описания.

Результат обучения — общее векторное пространство, в котором фотография кота и слово «кот» на разных языках оказываются буквально рядом друг с другом, хотя исходно это данные совершенно разной природы. Благодаря этому свойству CLIP и похожие модели решают сразу несколько практических задач без переобучения под конкретный список категорий.

  • Поиск изображений по текстовому описанию — запрос переводится в вектор и сравнивается с векторами всех фотографий в базе.
  • Классификация «с нуля» — вместо обучения на размеченных примерах модели достаточно сравнить вектор фото с векторами текстовых названий классов.
  • Передача мультимодальных способностей другим нейросетям — векторы CLIP используют как готовый «строительный блок» для генеративных моделей и визуальных ассистентов.
Сравнение CLIP с классическим классификатором ResNet101 показало, что на изображениях одного и того же объекта в разных стилях и условиях съёмки (например, бананы на рисунках, фотографиях и в мультяшном виде) CLIP демонстрирует заметно более стабильную точность распознавания — модель гораздо устойчивее к смене освещения, ракурса и художественного стиля, чем нейросети, обученные под фиксированный набор классов.

Именно эта устойчивость к вариативности реальных фотографий и делает подобные модели основой современных сервисов поиска по картинке: пользователь может сфотографировать один и тот же предмет под любым углом и при любом освещении, а система всё равно найдёт его смысловой эквивалент в базе — товар, похожее изображение или подходящее текстовое описание.

Почему CLIP работает лучше на «сложных» фото Обычный классификатор учится распознавать объект строго на тех вариациях, которые встречались в его обучающей выборке, — стоит изменить ракурс или стиль изображения сильнее привычного, и точность резко падает. CLIP обучается не на конкретных пикселях, а на связи между изображением и его смысловым описанием на огромном и разнородном массиве интернет-данных, поэтому у модели формируется более общее, устойчивое к вариациям понимание того, как выглядит объект в принципе — а не только в тех ракурсах, что попались во время обучения.

Обратный поиск по изображению как источник контекста

Если CLIP и похожие модели связывают картинку со смыслом слова, то обратный поиск по изображению (reverse image search) решает другую задачу — находит, где ещё в интернете встречается это же самое или очень похожее изображение. Технически это называется CBIR (content-based image retrieval, поиск изображений по содержимому): система не читает подписи и метаданные, а анализирует сами пиксели.

Работает это в несколько шагов: алгоритм извлекает из картинки математические признаки — цветовые гистограммы, контуры форм, градиентные узоры — и сжимает их в компактный «отпечаток» в виде вектора чисел. Затем этот отпечаток сравнивается с индексом, где уже хранятся вектора миллиардов ранее просканированных изображений, а на выходе система выдаёт наиболее близкие совпадения, отсортированные по степени схожести.

CBIR (content-based image retrieval)
Метод поиска изображений, при котором в качестве запроса используется само изображение, а не текстовое описание или метаданные к нему.
По оценкам отраслевых обзоров, база TinEye — одного из старейших сервисов обратного поиска — насчитывает свыше 78,7 млрд проиндексированных изображений, а аудитория Google Lens превышает 1,5 млрд пользователей.

Именно эта технология превращает поиск по фото в источник дополнительного контекста, которого не было в исходном запросе пользователя. Загрузив снимок, можно узнать не только «что это», но и где ещё это изображение публиковалось, — а значит, получить косвенные подсказки о происхождении, авторстве или актуальности картинки.

  • Поиск первоисточника фотографии — на каком сайте и когда снимок появился впервые.
  • Проверка фактов — используется ли старая фотография под видом свежих новостей (частый приём при распространении фейков).
  • Поиск товара по фото — сопоставление снимка с карточками одинаковых или похожих изделий на маркетплейсах.
  • Защита авторских прав — обнаружение неавторизованных копий изображения на чужих ресурсах.

В «Яндекс Картинках» эта функциональность оформлена как отдельная кнопка «Похожие» под развёрнутым изображением в результатах поиска: сервис явно разделяет обычный визуальный поиск («что на фото») и функцию нахождения визуально похожих карточек — что особенно полезно при подборе товаров, для которых внешний вид важнее текстового описания.

Для журналистов и фактчекеров обратный поиск давно стал рабочим инструментом верификации: если под якобы «свежим» кадром с места событий обратный поиск находит идентичное изображение, опубликованное несколькими годами ранее в другом контексте, это прямой сигнал о манипуляции. Мультимодальные ассистенты используют похожий принцип и внутри диалоговых ответов — прежде чем что-то утверждать про присланное пользователем фото, система может «на всякий случай» свериться с уже известными в сети похожими изображениями, а не полагаться только на собственную догадку.

Чем обратный поиск отличается от распознавания объектов Распознавание объектов (детекция) отвечает на вопрос «что изображено на фото» в общем виде — кошка, автомобиль, конкретная модель кроссовок. Обратный поиск отвечает на другой вопрос — «где ещё в сети встречается это же самое изображение» — и не обязательно понимает смысл того, что на нём происходит. На практике современные сервисы комбинируют оба подхода: сначала распознают объект и его категорию, а затем внутри этой категории ищут визуально ближайшие совпадения, чтобы результат был и осмысленным, и точным одновременно.

В каких задачах выгоднее искать по фото

В каких задачах выгоднее искать по фото

Разобрав, как технически устроены визуальный и текстовый поиск, логично перейти к практическому вопросу — а когда вообще выгоднее показать системе картинку, а не пытаться описать её словами? Ответ прямой: там, где ключевая информация изначально визуальна и плохо переводится в текст без потери смысла.

Главный критерий простой: если для точного текстового запроса потребовалось бы перечислить десяток характеристик — форму, цвет, узор, пропорции, — а результат всё равно останется приблизительным, фото решает задачу быстрее и точнее. Это касается сразу нескольких категорий пользовательских сценариев.

  • Распознавание физических объектов, для которых нет точного названия в голове у пользователя — растения, породы животных, модели техники, архитектурные сооружения.
  • Подбор товаров по внешнему виду — одежда, обувь, мебель, декор, — где важны силуэт, фактура и цвет, а не только категория.
  • Работа с текстом, который физически недоступен для набора — вывески на другом языке, объявления, этикетки, рукописные записи, экранные скриншоты.
  • Верификация и проверка происхождения снимка — когда важно не «что на фото», а «встречалось ли это изображение раньше и где».

Свежее исследование российского рынка это подтверждает: по данным опроса Ozon, проведённого среди более 1000 россиян в возрасте от 18 до 55 лет, более половины опрошенных хотели бы пользоваться функцией поиска по фотографии на маркетплейсах — именно потому, что она избавляет от необходимости подбирать точные слова для описания понравившегося товара.

Более половины россиян хотели бы пользоваться функцией поиска по фотографии — такой инструмент помогает найти понравившийся товар по снимку, не подбирая точные слова для запроса.

Похожая картина и в fashion-сегменте за рубежом: по данным отраслевого исследования WGSN за 2024 год, внедрение визуального поиска на торговых платформах повышает точность соответствия ожиданиям покупателя примерно на 37% по сравнению с обычным текстовым запросом, а пользователи, подбирающие вещи по референсу, в среднем реже оформляют возврат. Причина в том, что силуэт, драпировку ткани и сочетание оттенков почти невозможно однозначно закодировать в ключевые слова — а вот эмбеддинг изображения «считывает» их сразу.

Визуальный запрос
Поисковый запрос, в котором роль ключевых слов выполняет само изображение — вместо текстового описания система анализирует пиксели и сопоставляет полученный эмбеддинг с базой похожих объектов.

Есть и обратная сторона: не любая задача выигрывает от смены текста на картинку. Если пользователю нужен не конкретный визуальный объект, а рассуждение, сравнение цен, инструкция или абстрактное понятие — текстовый запрос по-прежнему остаётся быстрее и точнее, потому что не требует от системы «додумывать», что именно на фото является главным. Именно поэтому большинство современных ассистентов не заменяют один канал другим, а комбинируют их — предлагая приложить фото и короткую подпись, когда задача пограничная.

Почему выгода не универсальна для всех типов товаров Визуальный поиск особенно хорошо работает для товаров, где внешний вид и есть главная характеристика — одежда, обувь, мебель, декор, произведения искусства. А вот для товаров, которые визуально почти неотличимы друг от друга при разных характеристиках — например, разные объёмы памяти одной модели смартфона или разные варианты комплектации бытовой техники, — фото само по себе не даёт системе нужной информации, и текстовое уточнение оказывается эффективнее.

Распознавание предметов, растений и мест

Эта категория задач — самая наглядная иллюстрация того, зачем вообще нужен поиск по картинке. Пользователь сталкивается с объектом, для которого не знает названия, а без названия невозможно составить текстовый запрос. Сфотографировать проще, чем подобрать слова для незнакомого цветка, редкой модели кроссовок или архитектурной детали на здании.

С распознаванием бытовых предметов современные системы компьютерного зрения справляются уверенно: чем более массовый и «типовой» объект, тем выше точность. А вот с растениями ситуация интереснее — здесь точность сильно зависит не столько от алгоритма, сколько от размера и качества базы видов, на которой он обучен.

Сервис База видов Точность на культурных растениях Точность на дикоросах
Google Lens встроен в общий индекс картинок ~92,6% заметно ниже на редких видах
PlantNet около 45 000 видов ~80% ~90%
PictureThis около 30 000 видов ~98% ~75%
Flora Incognita около 20 000 видов ~85% ~92%

Разброс в таблице объясняется просто: Google Lens — не специализированное ботаническое приложение, а универсальный визуальный поисковик, который заодно распознаёт и растения. Он отлично справляется с популярными видами вроде розы или фикуса, но чаще ошибается на осоках, злаках и лишайниках, поскольку выдаёт первое похожее по эмбеддингу совпадение, не сверяясь с регионом или сезоном произрастания. Специализированные ботанические сервисы, обученные на узкой предметной области, наоборот, точнее на редких видах, но проигрывают на культурных сортах, которых меньше в их базе.

По данным сравнительного тестирования, точность определения растений через Google Lens в среднем составляет около 92,6% на распространённых видах — этот показатель заметно выше, чем у специализированного бесплатного сервиса PlantNet (около 55–80% в зависимости от выборки), но заметно проседает на редких и культурных сортах.

С поиском мест по фотографии всё ещё сложнее, потому что задача принципиально иная: система не просто классифицирует объект, а пытается сопоставить снимок с конкретной точкой на карте. Здесь работает та же логика, что и в обратном поиске по изображению, — алгоритм ищет визуально похожие кадры в собственном индексе и делает вывод по совпадениям.

  • Известные достопримечательности, туристические улицы и популярные смотровые площадки система определяет быстро и точно — потому что таких снимков в индексе уже миллионы.
  • Обычные дворы, спальные районы и малоизвестные локации распознаются намного хуже — в лучшем случае удаётся определить страну или регион.
  • Без вспомогательных данных — EXIF-метаданных, характерных вывесок или архитектурных ориентиров — точный адрес система угадывает крайне редко.

Иными словами, поиск места по фото работает не как «магическая геолокация», а как продвинутая версия обратного поиска: система сверяет снимок с тем, что уже когда-то было сфотографировано и проиндексировано другими людьми. Если место никогда раньше не попадало в объектив чужой камеры, никакой алгоритм не назовёт точный адрес — максимум предположит по ландшафту и растительности примерный регион.

Геолокация по изображению
Определение места съёмки снимка на основе сопоставления визуальных признаков фото с базой ранее проиндексированных изображений известных локаций, а не путём прямого «распознавания координат».
Почему один и тот же алгоритм может «путать» похожие объекты Ошибки чаще всего возникают там, где визуальное сходство выше семантического: два разных вида растений с одинаковой формой листа, две модели смартфонов с идентичным корпусом, два города со схожей архитектурой советской застройки. Алгоритм компьютерного зрения принимает решение по совокупности пикселей, а не по знанию биологии или географии, поэтому визуально похожие, но по сути разные объекты — его самое слабое место.

Перевод и разбор текста со скриншотов и вывесок

Перевод и разбор текста со скриншотов и вывесок

Отдельная категория задач, где фото объективно выгоднее набора текста, — работа с чужим языком или сложной нотацией прямо на месте. Столкнувшись с меню в кафе на незнакомом языке, инструкцией к лекарству или указателем на вокзале, человек физически не может быстро перепечатать иероглифы или диакритические знаки в текстовое поле — а вот сфотографировать вывеску можно за секунду.

Технически такой перевод — это связка сразу двух процессов: сначала OCR распознаёт символы на снимке и превращает пиксели в машиночитаемый текст, а затем модуль перевода уже работает с этим текстом как с обычным текстовым запросом. Именно поэтому качество итогового перевода напрямую зависит от чёткости снимка: смазанный кадр или блик приводят к ошибкам ещё на этапе распознавания символов, до всякого перевода.

Похожий принцип используется и в другой массовой задаче — разборе учебных заданий по фотографии. Ученик фотографирует условие из учебника или тетради, а сервис распознаёт печатный или рукописный текст, формулы и схемы, после чего выдаёт пошаговое решение. По схожему сценарию работает и сервис https://www.euroki.org/gdz-po-foto, где фотография страницы с заданием служит отправной точкой для поиска готового решения — то есть заменяет собой длинный текстовый запрос с переписыванием условия вручную.

Точность такого распознавания сильно различается в зависимости от типа контента на снимке — это подтверждают и данные по теме OCR из предыдущих разделов статьи, и отраслевые обзоры сервисов для учёбы.

Тип контента на фото Типичная точность распознавания Основная причина ошибок
Печатный текст (учебник, вывеска, меню) 96–98% блики, низкое разрешение камеры
Рукописный текст (конспект, тетрадь) 70–85% индивидуальный почерк, слитное написание
Математические формулы и символы 80–95% на стандартных задачах сложная вложенная нотация — дроби, интегралы, индексы
По оценкам отраслевых обзоров сервисов для учёбы, точность распознавания печатного текста на фотографиях из учебников достигает 95–98%, тогда как аккуратный рукописный текст распознаётся корректно в 70–85% случаев — а неразборчивый почерк снижает этот показатель ещё сильнее.

С переводчиками по камере ситуация похожая, но с дополнительным нюансом: система обрабатывает не изолированный текстовый блок, а текст в естественной среде — на вывеске, упаковке, дорожном знаке, — где шрифт, угол съёмки и фон постоянно меняются. Именно поэтому современные переводчики вроде Яндекс Переводчика или Google Объектива распознают крупный контрастный текст ощутимо лучше, чем убористую мелкую печать под углом.

  • Меню и вывески — перевод чаще всего срабатывает мгновенно благодаря крупному шрифту и хорошему контрасту.
  • Инструкции и этикетки — точность снижается из-за мелкого кегля и большого объёма текста в кадре.
  • Рукописные записки и письма от руки — самый сложный случай даже для продвинутых систем распознавания.
OCR-перевод по камере
Комбинированный процесс, при котором система сначала распознаёт текст на изображении методом оптического распознавания символов, а затем передаёт полученную текстовую строку в модуль машинного перевода.
Почему разработчики рекомендуют дублировать сложный текст вручную Если система не смогла корректно распознать формулу или редкое слово с фото, разумнее не пытаться переснять кадр заново под другим углом, а быстро продублировать нечитаемый фрагмент текстом. Это занимает считаные секунды, зато исключает саму возможность ошибки на этапе OCR — а значит, и все последующие ошибки перевода или решения, которые из неё вытекают.

Ограничения поиска по изображению в российских сервисах

Технологии визуального поиска в России развиваются в особых условиях: часть мировых лидеров индустрии работает с перебоями или недоступна напрямую, а российские аналоги пока уступают им по охвату базы. Это создаёт практический разрыв между тем, что теоретически умеет поиск по картинке, и тем, что реально доступно рядовому пользователю здесь и сейчас.

Ключевая проблема — доступность сервисов. На протяжении 2025–2026 годов доступность части продуктов Google в России неоднократно снижалась: в июле 2026 года пользователи из Москвы, Санкт-Петербурга и ещё нескольких регионов фиксировали падение доступности сервисов компании до 54,8%, что расценивалось как возможное тестирование более широких ограничений. При этом официальной блокировки поиска Google на тот момент подтверждено не было — ситуация регулярно балансирует между «сбоем», «замедлением» и точечными ограничениями отдельных функций.

По данным отраслевого обзора блокировок в РФ на май 2026 года, поиск Google формально продолжает работать, однако для большинства русскоязычных запросов Яндекс уже эффективнее — а YouTube как источник визуального контента для Google Lens официально выведен из Национальной системы доменных имён с февраля 2026 года.

Из-за этого Google Lens — один из самых мощных инструментов визуального поиска в мире с аудиторией свыше 1,5 млрд пользователей — на практике доступен российским пользователям с оговорками: часть функций работает нестабильно, а привязанные к нему сервисы вроде YouTube или Google Покупок то замедляются, то оказываются вне доступа без обходных инструментов. Это заставляет пользователей и бизнес переориентироваться на отечественные альтернативы или комбинировать сервисы.

  • Яндекс Картинки остаются главной доступной альтернативой для визуального поиска на русскоязычном рынке, но по независимым оценкам уступают Google Lens в точности распознавания зарубежных товаров и нишевых объектов.
  • Яндекс Маркет и AliExpress предлагают встроенный поиск по фото прямо в интерфейсе, тогда как крупные площадки вроде Ozon такой функции в приложении и на сайте официально не имеют.
  • Отечественные разработки computer vision, такие как VisionLabs и Yandex Vision, ориентированы в первую очередь на корпоративный и государственный сегмент, а не на массовый потребительский поиск.

Разница в точности хорошо видна на конкретном кейсе с поиском товаров. Согласно практическим тестам сервисов для маркетплейсов, при поиске популярных товаров через Google Lens точность совпадений достигает 85–90%, тогда как у Яндекс Картинок для аналогичной задачи — около 70–75%, причём отставание особенно заметно именно на зарубежных брендах, где база индексации у российского сервиса меньше.

Параметр Google Lens Яндекс Картинки
Доступность в РФ без VPN нестабильная, с перебоями полная
Точность на популярных товарах ~85–90% ~70–75%
Точность на зарубежных брендах выше заметно ниже
Интеграция с российскими маркетплейсами косвенная прямая (Яндекс Маркет)

Отдельная проблема — отсутствие единого стандарта у самих маркетплейсов. Даже там, где функция поиска по фото формально существует, её качество сильно зависит от чистоты фотографии и наличия узнаваемых визуальных маркеров вроде логотипа или уникального дизайна упаковки: без них точность распознавания редких или handmade-товаров, по независимым тестам, падает до 20–40%.

Импортозамещение в компьютерном зрении
Процесс замены зарубежных технологий и сервисов распознавания изображений на российские разработки, обусловленный ограничением доступа к иностранному ПО и требованиями регуляторов к критической инфраструктуре.
Почему бизнес в России чаще выбирает отечественные CV-решения для внутренних задач Для государственного сектора и объектов критической информационной инфраструктуры использование зарубежных технологий компьютерного зрения ограничено требованиями регуляторов и включением продукта в реестр отечественного ПО. Именно поэтому такие компании, как VisionLabs, ориентированы не на массовый потребительский поиск по картинке, а на закрытые корпоративные и государственные внедрения — распознавание лиц, видеоаналитику, системы контроля доступа, — где доступность зарубежного сервиса не гарантирована в принципе.

Когда текстовый запрос остаётся точнее

Когда текстовый запрос остаётся точнее

Несмотря на бурное развитие мультимодальных систем, текстовый поиск сохраняет заметное преимущество там, где важна не картинка, а смысл, абстракция или точная формулировка. Изображение хорошо передаёт внешний вид объекта, но плохо справляется с понятиями, которые нельзя увидеть глазами.

Абстрактные и логические запросы

Если пользователю нужен ответ на вопрос вроде «почему растёт инфляция» или «как оформить возврат товара», фотография здесь бессмысленна — такой запрос изначально существует только в виде текста. Алгоритму не нужно ничего реконструировать и угадывать фокус внимания на кадре: намерение уже сформулировано словами, и система сразу сопоставляет его с базой знаний через смысловое сходство.

Текстовый запрос незаменим и в задачах, где важны причинно-следственные связи, сравнения или условия («какой ноутбук лучше для монтажа видео до 100 000 рублей») — картинка не способна закодировать такие параметры и ограничения.

Точность формулировки против визуального шума

Другая сильная сторона текста — возможность мгновенно уточнить запрос: добавить слово, убрать уточнение, изменить порядок приоритетов. Визуальный поиск такой гибкости не даёт — если система «зацепилась» не за тот объект на фото, пользователю проще переснять кадр или вовсе перейти на текст, чем скорректировать уже отправленное изображение.

  • Точные технические характеристики (артикул, модель, версия ПО) надёжнее вводить текстом — на фото они могут быть нечитаемы или отсутствовать вовсе.
  • Запросы с отрицанием («без сахара», «не из хлопка») текстовый поиск обрабатывает напрямую, а визуальные системы такие конструкции распознают ненадёжно.
  • Юридические, медицинские и финансовые формулировки требуют терминологической точности, которую даёт только явно написанное слово.

Мультимодальность как противовес, а не замена

Даже в 2026 году, когда российские сервисы активно внедряют мультимодальные алгоритмы, разработчики признают ограниченность визуального канала. В августе 2026 года «Яндекс» обновил Поиск по картинкам так, чтобы система одновременно анализировала изображение и текст на странице, а не только одно из них.

Если на фотографии изображена одна модель товара, а в тексте указана другая, система перепроверит данные и с большей вероятностью установит, какая модель действительно показана на изображении.

Это показывает обратную сторону визуального поиска: фото имеет приоритет ровно тогда, когда речь о внешнем виде, но для отсеивания шума и проверки достоверности алгоритму всё равно нужен сопровождающий текст. Там же, где текста на странице просто нет или сцена перегружена (например, заполненная товарами витрина), система рискует ошибочно определить объект — и тогда именно текстовый запрос с точным названием остаётся надёжнее.

Когда визуальный шум мешает алгоритму

Низкое качество снимка, сложные многообъектные сцены и отсутствие текстового контекста на странице снижают точность визуального анализа. Бренд, чьё изображение не сопровождается пояснительным текстом, рискует быть неверно распознанным даже при качественной фотографии — здесь текстовое описание страницы работает как «страховка» для алгоритма.

Сравнение сценариев

Задача Текстовый запрос Визуальный запрос
Абстрактное понятие, причина, инструкция Точен и однозначен Неприменим
Уточнение и корректировка «на лету» Легко переформулировать Требует новой фотографии
Артикул, версия, точное название модели Надёжная передача деталей Часто нечитаемо или отсутствует
Запрос с отрицанием или условием Обрабатывается напрямую Распознаётся ненадёжно
Внешний вид, цвет, узор, точный визуальный стиль Теряет детализацию при описании словами Передаёт точно
Loss of fidelity (потеря детализации)
Ситуация, когда сложный визуальный признак — оттенок, узор, форма — невозможно точно передать словами, из-за чего текстовый запрос теряет часть исходного смысла.

Таким образом, текст остаётся оптимальным каналом не потому, что он «проще» изображения, а потому что он изначально несёт готовую, однозначную абстракцию — именно то, чего визуальному запросу приходится добиваться через дополнительную реконструкцию намерения.

Что выбрать: фото или слово

Текст и изображение — это два разных языка запроса к системе, и каждый решает свою задачу лучше другого. Там, где нужную информацию сложно описать словами — редкое растение, товар по силуэту, вывеска на незнакомом языке или условие задачи в учебнике — фото превращает запрос в один снимок вместо долгих формулировок, а эмбеддинги и компьютерное зрение берут интерпретацию на себя. Там же, где важна точность формулировки, отрицания или абстрактные условия, текстовый запрос остаётся быстрее и надёжнее, потому что его легко скорректировать на лету. Российские сервисы вроде Яндекс Картинок и специализированные решения на базе мультимодальных моделей постепенно сокращают разрыв с зарубежными аналогами, но пока уступают им в охвате баз и стабильности. Осознанный выбор между поиском по фото и текстом — это не вопрос технологической моды, а вопрос того, какой формат точнее передаёт суть вашего вопроса.

Если у вас накопилась фотография задания, вывески или товара, который сложно описать словами — попробуйте оба способа поиска и сравните, какой даст более точный и понятный ответ именно в вашем случае.