Александр Шефер

Открыт для проектов

Обсудить проект

Открыт для проектов

Направление

Быстрый контакт

demo

Корпоративный поиск по 40 000 документов

Поиск ответа в регламентах — с 25 минут до 40 секунд

RAG-платформа поверх разрозненного архива регламентов, чертёжной документации и переписки. Отвечает со ссылкой на конкретный пункт документа и честно сообщает, когда ответа в базе нет.

Клиент
Demo Engineering Group
Отрасль
Промышленный инжиниринг
Роль
Ведущий инженер RAG-платформы
Год
2026
Услуги
RAG, Корпоративный поиск, Интеграции

01

Контекст

Инженерная документация копилась 14 лет и лежала в четырёх местах: файловый архив, две вики и почта. Поиск работал по названию файла. Новый сотрудник выходил на нормальную скорость примерно за квартал.

02

Проблема

Документы противоречат друг другу: у одного регламента бывает шесть редакций, и только одна действующая. Ответ «по мотивам старой редакции» здесь опаснее, чем отсутствие ответа. Плюс жёсткое требование: система не должна показывать пользователю то, к чему у него нет доступа.

03

Решение

Пайплайн из трёх слоёв. Слой нормализации разбирает PDF, DOCX и сканы, извлекает таблицы и восстанавливает структуру разделов. Слой индексации хранит чанки вместе с метаданными редакции, статусом действия и матрицей доступа; поиск гибридный — плотные векторы плюс BM25, затем переранжирование. Слой ответа собирает выжимку строго из найденных фрагментов, приводит точную ссылку на пункт и редакцию, а при недостаточной уверенности возвращает не ответ, а список документов для чтения.

04

Как работает

  1. Инвентаризация архива

    Обход всех источников, дедупликация по содержимому, определение действующей редакции по метаданным и заголовкам.

  2. Нормализация

    Разбор PDF и DOCX с сохранением структуры разделов и таблиц. Сканы проходят OCR, качество распознавания проверяется выборочно.

  3. Индексация с правами

    Каждый чанк получает метки: документ, редакция, статус, раздел, группы доступа. Фильтрация по правам происходит до поиска, а не после.

  4. Запрос

    Гибридный поиск возвращает кандидатов, переранжирование оставляет лучшие фрагменты в пределах бюджета контекста.

  5. Ответ со ссылками

    Модель отвечает только по найденным фрагментам. Каждое утверждение сопровождается ссылкой на пункт и редакцию документа.

  6. Отказ вместо догадки

    Если уверенность ниже порога или найдены противоречащие редакции, система показывает документы и различия, но не формулирует ответ сама.

05

Интеграции

  • SharePoint и файловый архив
  • Confluence
  • Active Directory — группы доступа
  • Grafana — метрики качества и нагрузки

06

Надёжность

Что сделано, чтобы система вела себя предсказуемо в эксплуатации, а не только на демонстрации.

  • Golden set из 180 вопросов с эталонными ссылками, прогон при каждом изменении индекса или промптов
  • Отдельная метрика «правильный документ, но неправильный пункт» — она ловила больше проблем, чем общая точность
  • Фильтрация по правам доступа до retrieval; тест проверяет, что чужой документ не попадает даже в кандидаты
  • Порог уверенности с честным отказом вместо правдоподобного вымысла
  • Пометка устаревших редакций в выдаче с явным предупреждением
  • Логи запросов без текста документов и без персональных данных

07

Результат

  • 25 мин → 40 с

    Время поиска ответа

    Медиана по 12 типовым задачам, замер на группе из 9 инженеров до и после внедрения.

  • 91%

    Ответ с корректной ссылкой

    Golden set из 180 вопросов, эталон размечен двумя экспертами предметной области.

  • 7%

    Доля честных отказов

    Случаи, когда система отказалась отвечать. Ручная проверка показала, что в 6 из 7 отказ был обоснован.

08

Моя роль

  • Архитектура пайплайна и модель метаданных редакций — лично
  • Гибридный retrieval, стратегия чанкинга и переранжирование — лично
  • Golden set и методика замеров — лично, разметка — эксперты клиента
  • OCR-конвейер для сканов — подрядчик клиента, я формулировал требования и принимал
  • Интеграция с Active Directory — команда ИТ клиента

09

Стек

  • Python
  • FastAPI
  • Qdrant
  • PostgreSQL
  • Claude
  • BM25 / гибридный retrieval
  • Unstructured
  • Grafana

Следующий проект

Конвейер разбора входящих документов

1 400 документов в сутки без ручного ввода данных