
Мэтчинг 50 млн товаров для PIM-платформы
Один и тот же товар у разных продавцов называется по-разному. Мы нашли такие пары среди 50 млн товаров — и не склеили похожие, но разные: с другим объёмом или оттенком.
Главное
Клиент — российская платформа, где бренды и магазины хранят карточки товаров. Такие системы называют PIM.
Задача — найти один и тот же товар в разных источниках. Один флакон шампуня у пяти продавцов записан пятью разными названиями. Пока их не свели, платформа видит пять разных товаров. Руками такое не сверить: даже по десять секунд на карточку выходят годы работы.
Мы сопоставили около 50 млн товаров. Одинаковые нашли, даже когда названия не совпадали. Похожие, но разные — с другим объёмом или оттенком — не склеили.
Ноябрь — декабрь 2025 года.
Один товар — разные названия
Вот как один и тот же товар записан на маркетплейсе и в каталоге клиента. Это пары из проекта.
Человек видит, что это одно и то же, за секунду. Программа, которая сравнивает буквы, не видит. Слова стоят в другом порядке, бренд то обычными буквами, то заглавными, половины слов во второй записи нет.
Похожие товары — не всегда одинаковые
Обратная ловушка опаснее. Названия почти совпадают, а товары разные. Такие пары тоже встречались в данных проекта.
Если склеить такие карточки, покупатель получит не тот оттенок. А мониторинг цен сравнит флакон на 250 мл с флаконом на 400 мл и покажет, что конкурент дешевле, хотя это не так.
Поэтому ошибка в склейке хуже пропущенной пары. Пропуск просто остаётся несведённым. Ошибка расползается по отчётам, и её никто не замечает.
Как мы это сделали: три проверки
Первая — название. Машина сравнивает смысл, а не буквы. Она понимает, что «матовая подводка matte signature» и «подводка Matte Signature» — про одно. Для каждой карточки она находит полсотни самых похожих товаров каталога.
Вторая — свойства товара. Какие именно, зависит от категории. У косметики это объём и оттенок, у одежды — размер и цвет, у бытовой химии — вес и количество в упаковке. Бренд сверяем всегда. Объём — с допуском 5%, чтобы «0,95 л» и «950 мл» не считались разными. Количество — точно.
Третья — фото. Одинаковый товар и выглядит одинаково: та же упаковка, тот же флакон. Фото ловит то, чего нет в тексте, — например, когда оттенок в карточке не указан, а на картинке виден.
Пара склеивается, только если прошла все три проверки. Остальное машина не трогает и отдаёт человеку. Человек смотрит только спорные пары, а не весь каталог.
Зачем это платформе
Клиенты платформы — бренды и магазины. Они хотят видеть, где продаётся их товар и по какой цене. Если товар не сопоставлен, его нет в отчёте. Если склеен неверно, отчёт показывает чужую цену. Поэтому здесь важны обе вещи сразу: найти как можно больше пар и не придумать лишних.
Кому это нужно
Всем, у кого товарные данные приходят из нескольких источников: маркетплейсам, дистрибьюторам, сетям с несколькими поставщиками, производителям, которые следят за ценами своих товаров. Без сопоставления сравнивать цены не с чем — вы сравниваете разные товары.
Пробное сведение на вашей выборке — бесплатно. Покажем обе цифры: сколько сведено и сколько ушло на проверку человеку.
Мэтчинг товаров — как это делается и сколько стоит. Другой наш проект: сопоставление ассортимента в аптечной рознице — справочник на 30 830 позиций, больше 20 источников, сверка каждый день.
Для технических специалистов
Кандидатов ищем векторным поиском по смыслу названия: текст собирается из названия, раздела и бренда, берём 50 ближайших с порогом сходства. Затем структурная проверка по набору свойств, который задаётся для каждой категории: бренд и цвет по смысловому сходству, объём с допуском 5%, количество точно. Третий шаг — сравнение изображений по визуальному сходству. Пара, не прошедшая проверку, помечается несведённой и уходит человеку.

Готовы передать рутину
ИИ-сотрудникам?
За 30 минут разберём задачу, которая съедает время команды, и честно скажем, стоит ли отдавать её ИИ.