Инструменты
и проекты
Наши собственные разработки, а также open-source проекты и модели, которые мы используем, изучаем или на которые опираемся в исследованиях.
Наши проекты
SPLASH / СПЛЭШ
Наш проектSKU Profiling, Linking, Assessment, Search & Heuristics
CI-платформа для кабельной отрасли. Парсинг PDF-смет конкурентов → извлечение физических осей из артикулов → осевой скоринг с весами → автоматический подбор аналогов из наличия. REST API для 1С/SAP.
Heuristics MCP Server
СкороMCP-сервер (Model Context Protocol) с набором скиллов для автоматизации эвристических задач: подбор аналогов, gap-анализ, классификация SKU. Позволит подключать агентов к нашим алгоритмам через стандартный протокол.
Entity matching и record linkage
Open-source инструменты для задач сопоставления записей, дедупликации и entity resolution.
Splink
Open SourceВероятностное связывание записей и дедупликация в масштабе. Работает на DuckDB, Spark, Athena, Postgres. Не требует обучающей выборки — Fellegi–Sunter модель с EM-алгоритмом.
Dedupe
Open SourceFuzzy matching с активным обучением: модель учится на ваших метках, задавая вопросы «это одна и та же запись?». Идеален для структурированных данных с шумом.
Ditto
Open SourceEntity matching на предобученных Transformer-моделях (BERT/RoBERTa). SOTA-результат: +29% F1 к предыдущим подходам. Аугментация, суммаризация, инъекция доменных знаний.
DeepMatcher
Open SourceНейросетевой фреймворк для entity matching от группы AnHai (UW-Madison). Атрибутивные эмбеддинги, внимание, разнообразные архитектуры сравнения.
pyJedAI
Open SourceEnd-to-end фреймворк для entity resolution. Полный пайплайн: блокировка → сравнение → кластеризация. Интеграция с NLP/DL-моделями, работа без размеченных данных.
Python Record Linkage Toolkit
Open SourceМодульный набор для record linkage: индексирование, блокировка, сравнение, классификация. Интеграция с pandas и scikit-learn. Идеален для прототипирования.
Модели и эмбеддинги
Предобученные модели и библиотеки для семантического поиска и векторного сравнения.
Sentence Transformers
Open SourceСтандартная библиотека для вычисления семантических эмбеддингов. Bi-Encoder для масштабного поиска, Cross-Encoder для точного попарного скоринга. 5000+ предобученных моделей на HuggingFace.
FAISS
Open SourceБиблиотека Meta для быстрого поиска ближайших соседей в пространствах высокой размерности. GPU-ускорение, миллиарды векторов, десятки алгоритмов квантизации и индексации.
Инфраструктура и протоколы
Протоколы, спецификации и инфраструктурные проекты, которые мы используем или планируем интегрировать.
Model Context Protocol (MCP)
Open SourceОткрытый стандарт Anthropic для подключения ИИ-агентов к внешним инструментам и данным. «USB-C для ИИ» — единый протокол вместо кастомных интеграций. Планируем MCP-сервер для наших алгоритмов.
Awesome MCP Servers
Open SourceКурируемый каталог MCP-серверов от сообщества. Прокси, утилиты, интеграции с базами данных, внешними API, файловыми системами. Ориентир для нашего собственного MCP-сервера.