Интернет-магазины, маркетплейсы, поставщики и сервисы мониторинга цен ежедневно работают с большими товарными каталогами. Один и тот же товар в разных источниках может называться по-разному, иметь сокращённое описание или отличаться порядком указания характеристик. Например, смартфон в одном каталоге обозначен полным названием модели, а в другом — только брендом, серией, объёмом памяти и цветом. Автоматическое сопоставление товаров помогает определить, что обе карточки относятся к одной позиции.
Такой процесс также называют товарным матчингом. Система получает сведения из нескольких каталогов, анализирует их и ищет совпадения. Главная задача заключается не в обнаружении похожих названий, а в точном определении идентичных товаров. Это важно, поскольку внешне близкие позиции могут отличаться комплектацией, размером, модификацией или техническими параметрами.
Как проходит автоматическое сопоставление
Сначала система собирает и подготавливает данные. Названия очищаются от лишних символов, повторяющихся пробелов, служебных слов и различий в написании. Обозначения приводятся к единому формату. Например, значения «128 ГБ», «128GB» и «128 gb» распознаются как одна характеристика.
После нормализации начинается сравнение карточек. Алгоритм определяет бренд, модель, артикул, категорию и основные свойства товара. Каждому совпавшему параметру может присваиваться определённый вес. Точное соответствие артикула обычно имеет большее значение, чем совпадение отдельных слов в названии.
По результатам анализа система рассчитывает вероятность того, что найденные позиции являются одним товаром. Очевидные совпадения объединяются автоматически. Карточки с недостаточным или противоречивым набором данных могут направляться на дополнительную проверку.
Какие данные использует система
Наиболее надёжными признаками считаются уникальные идентификаторы. К ним относятся:
- артикул производителя;
- штрихкод EAN, UPC или GTIN;
- код модели;
- SKU поставщика;
- серийное или каталожное обозначение.
Если в обоих источниках указан одинаковый код производителя, сопоставление обычно выполняется с высокой точностью. Однако идентификаторы присутствуют не всегда. Некоторые поставщики используют собственные артикулы, а продавцы могут допускать ошибки при заполнении карточек. В таких случаях система обращается к другим данным.
Большое значение имеет название товара. Алгоритм выделяет из него бренд, серию, модель и характеристики. Он учитывает перестановку слов, сокращения, транслитерацию и разные варианты написания торговой марки. При этом простого совпадения названий недостаточно. Формулировка «холодильник двухкамерный белый» может относиться к десяткам различных моделей.
Для повышения точности анализируются характеристики: размеры, вес, объём, мощность, материал, цвет, количество предметов, диагональ, тип подключения и другие параметры. Набор признаков зависит от товарной категории. Для обуви важны размер, цвет и материал, для бытовой техники — модель, мощность и габариты, для автозапчастей — номер детали и совместимость.
Дополнительно могут использоваться описания, фотографии, категория каталога и сведения о комплектации. Анализ изображения помогает распознать внешний вид товара, упаковку, цвет или маркировку. Однако фотография обычно служит дополнительным признаком, поскольку разные продавцы могут использовать одинаковые изображения для нескольких модификаций.
Почему качество исходных данных так важно
Результат сопоставления напрямую зависит от полноты и точности карточек. Если в каталоге отсутствуют артикулы, перепутаны бренды или характеристики записаны в произвольной форме, вероятность ошибки возрастает. Особенно сложно различать варианты одной модели, отличающиеся объёмом памяти, размером, цветом или комплектацией.
Перед запуском матчинга желательно привести категории и характеристики к общей структуре, устранить дубли, исправить опечатки и унифицировать единицы измерения. Чем больше значимых параметров доступно системе, тем увереннее она отделяет точное совпадение от простого сходства.
Автоматическое сопоставление позволяет регулярно обрабатывать тысячи и миллионы карточек, обновлять связи между каталогами и находить новые позиции. Полученные результаты можно использовать для мониторинга цен, анализа ассортимента конкурентов, объединения предложений поставщиков и устранения дублей. Ручная проверка при этом сохраняется для спорных случаев, где данных недостаточно для уверенного решения
При подготовке статьи частично использованы материалы с сайта idatica.com — как работает автоматическое сопоставление товаров
Дата публикации: 11 мая 2022 года