TenderDataHub × векторный поиск

Закупочные данные для семантического поиска

Программный интерфейс (API), исторические выгрузки и документация для поиска похожих тендеров, товарного сопоставления, рекомендаций, дедупликации и аналитических ИИ‑сервисов.

Данные для семантического поиска
Данные для семантического поискаТендеры, контракты, документы и организации

Пять прикладных сценариев

Похожие тендеры

Поиск закупок с близким смыслом даже при разной терминологии и формулировках.

Товарные и контрактные аналоги

Сопоставление позиций, описаний, КТРУ и ОКПД2 для оценки цен и конкуренции.

Многоязычный поиск RFQ

Общее пространство эмбеддингов для запросов и объявлений на разных языках.

Поиск по документации

Семантическое извлечение по фрагментам OCR‑текста, требованиям, приложениям и техническим заданиям.

Рекомендации поставщикам

Подбор релевантных возможностей по профилю компании, истории участия и товарам.

Рабочая архитектура

API, Parquet, файлы→Нормализация и чанки→Эмбеддинги→ANN + фильтры→Переранжирование и оценка

Метаданные закупки остаются отдельными фильтруемыми полями: дата, регион, заказчик, отрасль, диапазон цены и классификаторы. Вектор не должен заменять точные ограничения доступа или бизнес‑фильтры.

Что индексировать

ОбъектТекст для эмбеддингаМетаданные
Тендерназвание, предмет, описание, требованиядата, регион, цена, закон, заказчик
Позициянаименование, характеристики, единица измеренияОКПД2, КТРУ, количество, цена
Документчанки (chunks) распознанного текстатип файла, страница, тендер, права
Организацияпрофиль, направления деятельности, товарыИНН, регион, роли, риск‑события

Контроль качества

  • соберите эталонный набор (golden set) из реальных поисковых задач
  • проверьте Recall@K и nDCG отдельно по коротким и длинным запросам
  • сравните плотное, разреженное и гибридное извлечение с одинаковым переранжировщиком
  • оцените влияние OCR, разбиения на чанки (chunking), дублей и смены модели эмбеддингов
  • контролируйте права доступа и фильтры до выдачи кандидатов

Пилот без самообмана

Начните с одного измеримого сценария и репрезентативного среза данных. Зафиксируйте базовую линию ключевого или SQL‑поиска, бюджет задержки и минимально допустимое качество. После этого сравнивайте модели и индексы на одном наборе запросов.

Источник данных и условия доступа: tenderdatahub.ru ↗