Корпоративный поиск по 40 000 документов
Поиск ответа в регламентах — с 25 минут до 40 секунд
RAG-платформа поверх разрозненного архива регламентов, чертёжной документации и переписки. Отвечает со ссылкой на конкретный пункт документа и честно сообщает, когда ответа в базе нет.
- Клиент
- Demo Engineering Group
- Отрасль
- Промышленный инжиниринг
- Роль
- Ведущий инженер RAG-платформы
- Год
- 2026
- Услуги
- RAG, Корпоративный поиск, Интеграции
01
Контекст
Инженерная документация копилась 14 лет и лежала в четырёх местах: файловый архив, две вики и почта. Поиск работал по названию файла. Новый сотрудник выходил на нормальную скорость примерно за квартал.
02
Проблема
Документы противоречат друг другу: у одного регламента бывает шесть редакций, и только одна действующая. Ответ «по мотивам старой редакции» здесь опаснее, чем отсутствие ответа. Плюс жёсткое требование: система не должна показывать пользователю то, к чему у него нет доступа.
03
Решение
Пайплайн из трёх слоёв. Слой нормализации разбирает PDF, DOCX и сканы, извлекает таблицы и восстанавливает структуру разделов. Слой индексации хранит чанки вместе с метаданными редакции, статусом действия и матрицей доступа; поиск гибридный — плотные векторы плюс BM25, затем переранжирование. Слой ответа собирает выжимку строго из найденных фрагментов, приводит точную ссылку на пункт и редакцию, а при недостаточной уверенности возвращает не ответ, а список документов для чтения.
04
Как работает
Инвентаризация архива
Обход всех источников, дедупликация по содержимому, определение действующей редакции по метаданным и заголовкам.
Нормализация
Разбор PDF и DOCX с сохранением структуры разделов и таблиц. Сканы проходят OCR, качество распознавания проверяется выборочно.
Индексация с правами
Каждый чанк получает метки: документ, редакция, статус, раздел, группы доступа. Фильтрация по правам происходит до поиска, а не после.
Запрос
Гибридный поиск возвращает кандидатов, переранжирование оставляет лучшие фрагменты в пределах бюджета контекста.
Ответ со ссылками
Модель отвечает только по найденным фрагментам. Каждое утверждение сопровождается ссылкой на пункт и редакцию документа.
Отказ вместо догадки
Если уверенность ниже порога или найдены противоречащие редакции, система показывает документы и различия, но не формулирует ответ сама.
05
Интеграции
- SharePoint и файловый архив
- Confluence
- Active Directory — группы доступа
- Grafana — метрики качества и нагрузки
06
Надёжность
Что сделано, чтобы система вела себя предсказуемо в эксплуатации, а не только на демонстрации.
- Golden set из 180 вопросов с эталонными ссылками, прогон при каждом изменении индекса или промптов
- Отдельная метрика «правильный документ, но неправильный пункт» — она ловила больше проблем, чем общая точность
- Фильтрация по правам доступа до retrieval; тест проверяет, что чужой документ не попадает даже в кандидаты
- Порог уверенности с честным отказом вместо правдоподобного вымысла
- Пометка устаревших редакций в выдаче с явным предупреждением
- Логи запросов без текста документов и без персональных данных
07
Результат
25 мин → 40 с
Время поиска ответа
Медиана по 12 типовым задачам, замер на группе из 9 инженеров до и после внедрения.
91%
Ответ с корректной ссылкой
Golden set из 180 вопросов, эталон размечен двумя экспертами предметной области.
7%
Доля честных отказов
Случаи, когда система отказалась отвечать. Ручная проверка показала, что в 6 из 7 отказ был обоснован.
08
Моя роль
- Архитектура пайплайна и модель метаданных редакций — лично
- Гибридный retrieval, стратегия чанкинга и переранжирование — лично
- Golden set и методика замеров — лично, разметка — эксперты клиента
- OCR-конвейер для сканов — подрядчик клиента, я формулировал требования и принимал
- Интеграция с Active Directory — команда ИТ клиента
09
Стек
- Python
- FastAPI
- Qdrant
- PostgreSQL
- Claude
- BM25 / гибридный retrieval
- Unstructured
- Grafana
Следующий проект
Конвейер разбора входящих документов
1 400 документов в сутки без ручного ввода данных