
Мэтчинг 50 млн товаров для Brandquad
Brandquad работает с товарными данными для электронной коммерции. К нам пришла задача сопоставления: понять, какие позиции в огромном массиве — это один и тот же товар.
В чём была задача
Один и тот же товар у разных поставщиков записан по-разному. Отличается порядок слов, единицы измерения, сокращения, лишние пробелы, латиница вместо кириллицы в названии бренда. Человек видит, что это одно и то же, за секунду. Программа, которая сравнивает строки буквально, не видит вообще.
А делать это руками на таком объёме нельзя: даже по десять секунд на позицию — это годы работы.
Что сделали
- Привели данные к сопоставимому виду: разобрали названия на составляющие, нормализовали единицы и написание.
- Настроили сопоставление, которое ищет одинаковые товары по смыслу, а не по совпадению символов.
- Отдельно разобрались со спорными случаями, где похожие позиции на деле разные — например, отличаются объёмом или комплектацией.
Результат
Обработан датасет примерно на 50 млн товаров. Это флагманский проект нашего направления работы с данными.
Почему это получилось
Совпадение искали по смыслу, а не по буквам: сначала данные привели к одному виду, потом сравнивали, что название означает на самом деле. Спорные случаи, где товары похожи, но не совпадают, не отдавали автоматике целиком — их разбирали отдельно. Это медленнее, чем сравнить строки посимвольно, зато не путает разные товары.
Такая работа нужна всем, у кого товарные данные приходят из нескольких источников: маркетплейсам, дистрибьюторам, сетям с несколькими поставщиками. Без сопоставления сравнивать цены не с чем — вы сравниваете разные товары.
Мэтчинг товаров — как это делается и сколько стоит. Решения для розницы и интернет-торговли.

Готовы передать рутину
ИИ-сотрудникам?
За 30 минут разберём задачу, которая съедает время команды, и честно скажем, стоит ли отдавать её ИИ.