Telegram-каналы, чаты, группы и сайты с объявлениями
Commercial Signals
Система мониторинга внешних источников, которая находит коммерчески значимые сообщения, определяет их intent, извлекает сущности и доставляет результат менеджеру в реальном времени.
Тысячи сообщений.
Несколько действительно важных.
В некоторых B2B-рынках значительная часть спроса, предложения и другой коммерчески важной информации появляется в Telegram-чатах, отраслевых сайтах и других внешних источниках.
Менеджерам приходится вручную мониторить большой поток публикаций, отделять реальные заявки от обсуждений и шума и самостоятельно определять, на какие сигналы нужно реагировать.
Большое количество источников
Тысячи новых сообщений и публикаций
Большая доля нерелевантного шума
Риск пропустить потенциальный коммерческий сигнал
От внешнего источника до готового сигнала
Система собирает данные из нескольких каналов, приводит их к единому формату, анализирует содержание и передаёт менеджеру только релевантные сообщения.
Новые сообщения и публикации автоматически попадают в систему
Исходный поток сохраняется до дальнейшей обработки
BUY / SELL / OTHER и извлечение предметных сущностей
Нормализованные записи готовы для поиска и фильтрации
Telegram, таблицы, выгрузки и другие интеграции
Аграрный отраслевой чат
Как менялась модель обработки
Сначала нужно было быстро проверить саму гипотезу: можно ли автоматически понимать коммерческий смысл сообщений и выделять нужные сущности. После этого основной задачей стали стоимость, скорость и независимость от внешних API.
Большие универсальные LLM
На первом этапе обработка тестировалась на YandexGPT 5 Pro. Параллельно проверялись локальные модели Qwen 7B и Qwen 14B. Задача этапа — понять, насколько хорошо универсальные модели справляются с классификацией сообщений и выделением сущностей в аграрной предметной области.
Переход к более лёгким облачным моделям
После подтверждения гипотезы использование большой LLM для каждого сообщения стало избыточным. Обработка была перенесена сначала на YandexGPT Mini, а затем тестировалась на облачной модели DeepSeek. Это позволило снизить стоимость и упростить обработку постоянного потока сообщений.
Собственный специализированный трансформер
После накопления размеченных данных появилась возможность обучить собственную модель под конкретную задачу. Трансформер определяет intent сообщения и извлекает предметные сущности, связанные с аграрным рынком.
Что система извлекает из сообщения
Каждое входящее сообщение проходит классификацию по intent, после чего из текста выделяются предметные сущности, которые можно использовать для поиска, фильтрации и дальнейшей автоматизации.
Купим пшеницу 4 класса, объём до 500 тонн. Самовывоз из Воронежской области. Рассмотрим предложения до 14 500 ₽/т.
Сообщение о покупке
Сообщение о продаже
Прочий контент и нерелевантный поток
Один поток данных — разные сценарии использования
После обработки сообщения сохраняются в единой структурированной базе. Дальше результат можно использовать по-разному в зависимости от рабочего процесса конкретного менеджера или отдела.
Telegram и сайты с объявлениями
BUY / SELL / OTHER и выделение сущностей
Все сообщения уже размечены и доступны для дальнейшей работы
Менеджер получает новые релевантные сигналы сразу после обработки.
Структурированные данные автоматически появляются в рабочей таблице.
Например, готовая выборка новых сигналов каждое утро или за выбранный период.
База может использоваться как источник для внутренних систем, аналитики и других бизнес-процессов.
С какими проблемами пришлось столкнуться
Основная сложность была не в самом сборе сообщений, а в том, чтобы стабильно превращать шумный поток из разных источников в пригодные для бизнеса сигналы.
Шум и нерелевантный контент
Большая часть входящего потока не содержит полезного коммерческого сигнала: обсуждения, пересылки, короткие ответы, реклама и служебные сообщения.
Отдельная классификация релевантности до дальнейшего анализа.
Неоднозначный intent
Одно и то же сообщение может выглядеть как вопрос, покупка или продажа в зависимости от формулировки и контекста.
Разметка примеров из предметной области и обучение модели на реальных типовых формулировках.
Стоимость больших LLM
При постоянном потоке сообщений вызов большой языковой модели для каждого сообщения быстро становится дорогим.
Переход от универсальной LLM к компактной модели, а затем к собственному специализированному трансформеру.
Задержка обработки
Коммерческий сигнал теряет ценность, если приходит менеджеру через значительное время после публикации.
Упрощение pipeline, быстрый inference и обработка новых сообщений сразу после поступления.
Разные форматы источников
Telegram, сайты и другие каналы отдают данные в разном виде и с разным количеством служебной информации.
Единый внутренний формат данных после слоя сбора и нормализации.
Извлечение сущностей
Товар, цена, объём, регион и условия поставки могут быть записаны десятками разных способов.
Entity extraction с нормализацией значений перед передачей результата менеджеру.
Вместо тысяч сообщений —
один понятный поток сигналов.
Система снимает с менеджера рутинный мониторинг и оставляет ему только ту часть работы, где действительно нужно принять решение.
Менеджеру не нужно самостоятельно просматривать весь поток сообщений и публикаций.
Значимые сообщения передаются сразу после появления и обработки.
Система постоянно работает со всеми подключёнными источниками.
Количество источников можно увеличивать без пропорционального роста ручной нагрузки.
Пшеница 4 класса · 500 т