
Я Аня, дизайнер студии «Контур». У нас в общей папке больше 40 000 фото: съёмки клиентов, референсы, забракованные макеты, детали текстур. Искать там что-то по имени файла — отдельная боль. Нужен кадр «переговорка с панорамным окном», а в файлах живёт IMG_2834.jpg. До недавнего времени честно проще было снимать заново.
Теперь я набираю фразу обычными словами — и за пару секунд получаю подборку кадров. Расскажу, что под капотом, потому что это меняет не только поиск.
Что такое эмбеддинг картинки — коротко и по делу
Модель смотрит на фото и превращает его в вектор — длинный список чисел. У базовой версии это 2048 чисел, у флагманской — 4096. Главное вот в чём: близкие по смыслу картинки получают близкие векторы. Не «похожие по цвету» и не «одинакового размера», а похожие по содержанию. Все «закаты над морем» собираются в одну область, все «люди за ноутбуками» — в другую. Фото впервые становится чем-то, что можно сравнивать математически.
Дальше начинается магия поиска. Мой текст «команда в офисе у окна» тоже превращается в вектор — и остаётся найти фото, чьи векторы ближе всего к нему. Так работает поиск по смыслу: не по тегам, которые кто-то вручную проставил, а по содержанию. Именно это стоит за подбором похожих товаров в каталоге, поиском украденных картинок и модерацией — система ловит дубли и запрещённое в потоке из миллионов фото по вектору, а не по глазам модератора.
Что именно вышло у Tencent
Команда WeChat Vision открыла WeMM-Embedding — веса и код лежат на GitHub. Модель существует в трёх размерах (2B, 4B и 9B) и понимает текст, картинки, видео и «смешанные» входы, где важно, в каком порядке элементы идут друг за другом. Это не игрушка: внутри Weixin модель вызывают больше миллиарда раз в день — в рекомендациях, поиске, каналах и моментах.
Старшая версия набрала 80,6 в бенчмарке MMEB-v2 и заняла первое место. А ещё у неё «матрёшечные» векторы: размерность можно урезать со стандартных 2048 до 256 или даже до 64 — без переобучения. Младшая 2B в 256 измерениях сохраняет 98,7% качества полного вектора.
Как я это применила в студии
Шаг 1. Поставила версию 2B локально — она не требует богатырской видеокарты, а через готовые обёртки (vLLM или SGLang) запускается пачками.
Шаг 2. Прогнала весь архив: каждое фото → свой вектор. Чтобы поиск летал по 40 000 файлов, обрезала векторы до 256 чисел — по качеству на глаз не потеряла ничего.
Шаг 3. Поиск: текст или картинка-референс → вектор → ближайшие фото. Клиент кидает любую картинку — и через секунду получает «вот 12 кадров, которые вы описывали».
Урок. Эмбеддинги — это не только поиск. Это ещё авто-теги, группировка съёмок по стилю, поиск дублей и подбор кадров под лендинг без листания папок. Один индекс — целый ворох задач.
Смысл не в том, чтобы найти картинку. А в том, чтобы картинка сама знала, что она значит. — Архон