RAG и база знаний для компаний

ИИ-поиск по документам для компаний и учреждений

Задайте вопрос по тысячам договоров, регламентов и инструкций и через несколько секунд получите точный ответ с указанием документа, пункта и страницы. Работает на наших дообученных моделях, а документы остаются у вас.

  • Каждый ответ со ссылкой на источник и страницу
  • Собственные модели, без передачи данных третьим лицам
  • Пилот на ваших документах за 4–6 недель
Интерфейс ИИ-поиска по документам с ответом и цитатой из договора

Источник: Правила внутреннего распорядка, с. 14

On-prem · данные остаются у вас

недель до пилота на ваших документах
4–6
языка вопросов и ответов
4
частные серверы или установка у вас
EU
стартовая цена пилотного проекта
2 000 €

Почему сейчас

Ответ есть, но быстро найти его никто не может

В большинстве компаний знания разбросаны по папкам, СЭД, почтовым архивам и старым версиям документов. Обычный поиск ищет точные слова, а сотрудники спрашивают своими словами.

  • Сотрудники ищут вместо того, чтобы работать

    Юрист открывает десять договоров, чтобы найти срок уведомления, инженер листает спецификации, а отдел кадров отвечает на одни и те же вопросы об отпусках. Это время не видно в отчётах, но оплачивается каждый день.

  • Знания остаются в головах и почте

    Решения, толкования и наработки по прошлым делам хранятся в переписке и у опытных коллег. Когда кто-то уходит или в отпуске, компания теряет доступ к информации, которая у неё уже есть.

  • Публичные ИИ-сервисы не подходят

    Договоры, данные клиентов и внутренние документы нельзя копировать в публичные чат-сервисы. Нужен ИИ-поиск, который работает на ваших документах, соблюдает права доступа и не отправляет данные за пределы организации.

Что мы создаём

Поиск, который понимает вопрос и показывает источник

Полностью собственное решение: от обработки документов и наших моделей до интерфейса для сотрудников и интеграции с системами, которые вы уже используете.

PDF, Word, Excel, почта и сканы

Обрабатываем документы во всех распространённых форматах, переводим сканы в текст с помощью OCR и сохраняем таблицы и вложения в структуре, по которой можно искать.

Ответ с документом и страницей

К каждому ответу система указывает документ, пункт и страницу и показывает цитату. Оригинал открывается одним кликом, и проверка толкования занимает секунды.

Права доступа как в ваших системах

Права берём из СЭД, SharePoint или Active Directory. Сотрудники получают ответы только из разрешённых им документов, а каждый запрос фиксируется в журнале.

Модели, дообученные на вашей терминологии

Адаптируем наши языковые и поисковые модели к вашей отрасли, сокращениям и стилю документов — на русском, английском, черногорском и других языках.

ИИ-агенты для резюме и сравнения

Помимо вопросов и ответов, агенты составляют краткие резюме, сравнивают версии договоров, извлекают сроки, суммы и обязательства и готовят таблицу для команды.

Частная инфраструктура или on-prem

Система работает на наших частных серверах в ЕС или на вашем оборудовании, при необходимости полностью без интернета. Документы никогда не отправляются во внешние ИИ-сервисы.

Как это работает

От папки с документами до проверяемого ответа

RAG-архитектура с гибридным поиском и собственными моделями — пять шагов, которые выполняются за несколько секунд.

  1. Подключение источников

    Подключаем общие папки, СЭД, SharePoint, почтовые архивы и ваши приложения и переносим права доступа.

  2. Обработка и индексация

    OCR, распознавание таблиц и разбиение на фрагменты с метаданными. Изменённые документы переиндексируются автоматически.

  3. Вопрос сотрудника

    Сотрудник спрашивает своими словами. Система проверяет, кто спрашивает, и ищет только в документах, доступных этому человеку.

  4. Гибридный поиск

    Поиск по смыслу и по ключевым словам, затем переранжирование, которое отбирает самые релевантные фрагменты.

  5. Ответ с источником

    Дообученная модель формирует ответ только из найденных фрагментов и указывает документ, пункт и страницу — или сообщает, что ответа в документах нет.

Применение по отраслям

Где ИИ-поиск по документам экономит больше всего времени

Наибольшую пользу получают команды, которые каждый день работают с большими массивами документов и должны точно знать, откуда взята информация.

Право и юридические фирмы

Договоры, законы и судебная практика

Поиск по материалам дел, договорам и нормативным актам по смыслу, с цитатой пункта или решения, чтобы ответ сразу можно было использовать в работе.

  • Поиск условий об ответственности в сотнях договоров
  • Ответы на основе законов и решений со ссылками
  • Извлечение сроков и обязательств из материалов дела

Банки и страхование

Процедуры и регулирование в одном месте

Сотрудники отделений, риск-менеджмента и комплаенса получают ответы из внутренних документов и нормативов, не дожидаясь, пока центральный офис найдёт нужный файл.

  • Вопросы о внутренних процедурах и условиях продуктов
  • Проверка соответствия требованиям регулятора
  • Поиск по полисам и правилам страхования

Государственное управление

Быстрые ответы на обращения граждан

Служащие ищут по законам, постановлениям и прежним решениям по похожим делам, а система работает на инфраструктуре учреждения.

  • Поиск по законам, решениям и официальным бюллетеням
  • Прежние решения по аналогичным делам
  • Подготовка ответов на запросы о доступе к информации

Строительство и инжиниринг

Техническая документация без пролистывания

Проекты, спецификации, стандарты и акты превращаются в базу знаний, где инженер спрашивает как коллегу и получает ответ со ссылкой на чертёж или страницу.

  • Поиск по проектам, спецификациям и стандартам
  • Сравнение версий технических условий и предложений
  • Повторное использование решений из прошлых проектов

Здравоохранение

Протоколы и инструкции под рукой

Медицинский персонал быстро находит протоколы, клинические рекомендации и инструкции к оборудованию, а при необходимости система устанавливается внутри учреждения.

  • Поиск по клиническим протоколам и рекомендациям
  • Инструкции к медицинскому оборудованию
  • Внутренние положения и процедуры качества

Производство и HR

База знаний для сотрудников

Рабочие инструкции, процедуры качества и кадровые положения доступны по одному вопросу — с компьютера или телефона, для новичков и опытных сотрудников.

  • Ответы об отпусках, льготах и правилах распорядка
  • Рабочие инструкции и процедуры качества ISO
  • Более быстрая адаптация новых сотрудников

Из нашей практики

Платформы, которые уже ищут по документам

Те же компоненты мы используем в проектах на ваших документах: обработку PDF, гибридный поиск, цитирование и разграничение доступа.

Sidro AI: Интеллектуальная база знаний для компаний

Sidro AI

Интеллектуальная база знаний для компаний

Наша платформа баз знаний: гибридный поиск с переранжированием, понимание PDF и таблиц и ответы со ссылками — основа наших проектов по поиску в документах.

  • React
  • Python
  • RAG
  • PostgreSQL
Kruna.ai: ИИ CRM для юридических фирм

Kruna.ai

ИИ CRM для юридических фирм

Юридический ИИ-ассистент, который отвечает на основе законодательства и судебной практики Черногории и к каждому ответу указывает закон, статью или решение.

  • Next.js
  • Spring Boot
  • RAG
  • PostgreSQL
Pečat: Цифровой архив и согласование документов

Pečat

Цифровой архив и согласование документов

Цифровой архив с версиями, маршрутами согласования и единым входом — именно такой источник документов и модель прав, на которых строится ИИ-поиск.

  • React
  • Spring Boot
  • PostgreSQL
  • OnlyOffice

Пакеты и цены

Начните с пилота, масштабируйте на всю компанию

Фиксированная цена за каждый этап, согласованная после короткого воркшопа, на котором мы изучаем ваши документы и вопросы.

Пилот

от 2 000 €разово · 4–6 недель

Один массив документов и одна команда, чтобы проверить точность на реальных вопросах до широкого внедрения.

  • Один источник документов (папка, СЭД или SharePoint)
  • OCR для отсканированных документов
  • Ответы с документом, пунктом и страницей
  • Измерение точности на ваших вопросах
  • Веб-интерфейс для пилотной команды
Запросить предложение

Чаще всего выбирают

База знаний компании

от 5 000 €разово + ежемесячная поддержка

Полноценный ИИ-поиск для нескольких отделов с правами доступа и моделями, адаптированными к вашей терминологии.

  • Несколько источников и автоматическая переиндексация
  • Права доступа из ваших систем
  • Дообучение модели на вашей терминологии
  • ИИ-агенты для резюме, сравнения и сроков
  • Вход через SSO и журнал запросов
  • Хостинг на частной инфраструктуре в ЕС
Запросить предложение

On-prem

По договорённостипосле технического воркшопа

Для банков, медицины, госучреждений и юридических фирм, чьи документы не должны покидать сеть.

  • Установка на ваш сервер или в частное облако
  • Модели работают полностью локально, без интернета
  • Интеграция с СЭД, почтовым архивом и приложениями
  • Журнал аудита каждого запроса и ответа
  • SLA и приоритетная поддержка
  • Обучение администраторов и пользователей
Запросить предложение

Помимо разработки есть ежемесячные расходы на хостинг и поддержку. Они зависят от объёма документов, числа пользователей и того, где работает система — на нашей инфраструктуре или у вас. Точную сумму вы получите в письменном предложении. Все цены

Сравнение

Почему не обычный поиск и не публичный ИИ-сервис

Обычный поиск не понимает вопрос, а публичные ИИ-сервисы не знают ваших документов и не должны их видеть. ProCode объединяет лучшее из обоих подходов.

КритерийИИ-поиск ProCodeПоиск по ключевым словамПубличные ИИ-сервисы
Понимает вопрос, заданный своими словамиДаНетДа
Ответ с документом, пунктом и страницейДаТолько список файловНет
Соблюдает права доступа ваших системДаДаНет
Документы остаются внутри организацииДаДаНет
Сканы и таблицыДаЧастичноЧастично
Модель адаптирована к вашей терминологииДаНетНет
Сообщает, если ответа в документах нетДаЧастичноНет
Интеграция с СЭД и SharePointДаЧастичноНет

Процесс

От воркшопа до продакшена

Понятные этапы с фиксированной ценой и измеримым критерием успеха перед каждым следующим шагом.

Запросить предложение
  1. Шаг 1 · 1 неделя

    Воркшоп и выбор документов

    Выбираем массив документов, определяем права доступа и вместе составляем реальные вопросы, на которых будем измерять точность.

  2. Шаг 2 · 1–2 недели

    Обработка и индексация

    OCR, распознавание таблиц, разбиение на фрагменты и подключение источников с автоматическим отслеживанием изменений.

  3. Шаг 3 · 1–2 недели

    Настройка модели и поиска

    Дообучение на вашей терминологии, настройка гибридного поиска и переранжирования, правила цитирования.

  4. Шаг 4 · 2 недели

    Пилот и проверка точности

    Пилотная команда работает с системой в ежедневных задачах, а мы измеряем точность, собираем отзывы и устраняем слабые места.

  5. Шаг 5 · постоянно

    Внедрение и поддержка

    Расширение на другие отделы, интеграции, обучение пользователей и регулярное улучшение моделей на основе новых вопросов.

Технологии

Полностью собственный стек

Все компоненты мы разрабатываем, адаптируем и размещаем сами, поэтому всегда знаем, где находятся ваши данные.

Обработка документов

  • OCR для сканов
  • Разбор PDF, Word и Excel
  • Распознавание таблиц
  • Разбиение на фрагменты
  • Метаданные и версии

Поиск

  • RAG-архитектура
  • Гибридный поиск
  • Собственные embedding-модели
  • Переранжирование
  • pgvector

Модели

  • Дообученные языковые модели
  • Локальный инференс
  • Оценка точности
  • Контроль цитирования

Инфраструктура

  • Python
  • PostgreSQL
  • Docker
  • Keycloak SSO
  • Частные серверы в ЕС
  • On-prem

Руководство

ИИ-поиск по документам: как он работает и как его внедрить

ИИ-поиск по документам становится одним из самых полезных применений искусственного интеллекта в компаниях и учреждениях. В этом руководстве объясняем, что такое RAG, почему собственные дообученные модели дают более надёжные ответы, чем публичные сервисы, как готовятся документы и как выглядит безопасное поэтапное внедрение.

Как работает RAG с цитированием источников

RAG (Retrieval-Augmented Generation) — архитектура, в которой ИИ сначала находит релевантные части ваших документов и только потом формирует ответ строго на их основе. Модель отвечает не «по памяти», а по фрагментам, которые может процитировать.

В наших системах это выглядит так: документы обрабатываются и делятся на смысловые фрагменты, каждый фрагмент получает векторное представление от нашей embedding-модели, а поиск сочетает сходство по смыслу с классическим поиском по словам. Затем переранжирование отбирает несколько лучших фрагментов, а дообученная языковая модель формирует ответ и указывает источники.

  • Гибридный поиск находит и точные названия, номера и коды, и вопросы, сформулированные иначе
  • Переранжирование снижает шум и передаёт модели только самые релевантные фрагменты
  • Правила цитирования обязывают модель подкреплять каждое утверждение документом и страницей
  • Если в документах нет ответа, система прямо сообщает об этом, а не угадывает

Почему собственные дообученные модели, а не публичные ИИ-сервисы

Публичные ИИ-сервисы созданы для общих разговоров. Они не знают ваших договоров, не соблюдают ваши права доступа, а каждый документ, который сотрудник туда копирует, покидает организацию. Для юридических, финансовых и медицинских данных это, как правило, недопустимо.

Поэтому ProCode использует собственные модели, дообученные под отрасль клиента: юридическую терминологию, технические сокращения, внутренние названия продуктов и язык, на котором работает команда. Модели работают на нашей частной инфраструктуре в ЕС или на вашем оборудовании, без передачи данных третьим лицам.

Дополнительное преимущество — предсказуемые расходы. Нет оплаты за каждый запрос иностранному поставщику, а модель не меняется без вашего ведома, поэтому качество ответов остаётся стабильным и измеримым.

Подготовка документов: сканы, таблицы и версии

Качество ответов больше всего зависит от качества обработки документов. Поэтому этому этапу мы уделяем особое внимание — и это работа, которую клиенту не нужно делать самому.

Сканы переводятся в текст с помощью OCR, таблицы сохраняются как таблицы, а приложения связываются с основным договором. Каждый фрагмент несёт метаданные: дату, тип документа, отдел и версию, поэтому система может отдавать приоритет действующему документу, а не старому черновику.

  • PDF, Word, Excel, PowerPoint и письма с вложениями
  • Отсканированные договоры, решения и протоколы через OCR
  • Общие сетевые папки, системы электронного документооборота и SharePoint
  • Автоматическая переиндексация новых и изменённых документов

Как мы измеряем точность и поддерживаем качество

ИИ-поиск полезен только тогда, когда ему доверяют. Поэтому точность мы оцениваем не «на глаз», а на наборе реальных вопросов с ожидаемыми ответами и источниками. Для каждого вопроса проверяем, нашла ли система нужный документ, верен ли ответ и действительно ли цитата подтверждает написанное.

После внедрения качество отслеживается постоянно. Пользователи одним кликом оценивают ответы, а вопросы без ответа показывают, какие документы нужно добавить или обновить. На основе этих данных мы периодически донастраиваем модели и поиск, поэтому со временем система становится точнее.

  • Тестовый набор вопросов, подготовленный вместе с вашими специалистами
  • Раздельное измерение точности поиска источников и точности ответов
  • Оценки пользователей и отчёт о вопросах без ответа
  • Повторное тестирование перед каждой новой версией модели

Интеграция с СЭД, почтой и бизнес-приложениями

Лучший результат достигается, когда ИИ-поиск работает там, где сотрудники уже работают. Помимо отдельного веб-интерфейса, мы встраиваем поиск в интранет, СЭД, CRM или систему ведения дел, а также предоставляем API для ваших внутренних систем.

Документы загружаются из общих сетевых папок, SharePoint, СЭД и почтовых архивов с автоматическим отслеживанием изменений. Когда регламент обновляется или к договору добавляется приложение, новое содержание становится доступным для поиска без ручной работы, а старая версия остаётся в архиве с понятной пометкой.

Безопасность, права доступа и GDPR

ИИ-поиск не должен становиться обходным путём к документам, которые сотрудник иначе не видит. Поэтому мы переносим права доступа из системы, где документы уже хранятся, и проверяем их перед каждым поиском, а не только при показе ответа.

Система ведёт журнал запросов и ответов, поддерживает единый вход (SSO) и может работать полностью без подключения к интернету. Обработка персональных данных соответствует GDPR: данные остаются в ЕС или у вас, а доступ и сроки хранения определяются вместе с вашим ответственным за защиту данных.

С чего начать: от пилота до всей компании

Самый надёжный путь — пилот на одном массиве документов, с которым команда работает каждый день: договорах, внутренних регламентах или технической документации. В начале мы вместе составляем около пятидесяти реальных вопросов с ожидаемыми ответами и измеряем на них точность до и после настройки.

Когда пилот подтверждает результат, систему расширяют на другие отделы и источники, подключают к СЭД и SSO и дополняют агентами для резюме и сравнения документов. Так инвестиции растут только после того, как польза подтверждена на ваших данных.

FAQ

Частые вопросы об ИИ-поиске по документам

Не нашли ответ? Напишите нам — ответим в течение одного рабочего дня.

Что такое RAG и как работает ИИ-поиск по документам?

RAG (Retrieval-Augmented Generation) — подход, при котором ИИ сначала находит релевантные фрагменты ваших документов и только потом формирует ответ строго на их основе. Мы обрабатываем документы и делим их на фрагменты, сочетаем поиск по смыслу и по словам, а наша дообученная модель формирует ответ с документом, пунктом и страницей. Сотрудники могут сразу проверить источник, а не верить ИИ на слово.

Какие документы и источники может искать система?

Поддерживаются PDF, Word, Excel, PowerPoint, письма с вложениями и отсканированные документы, которые мы переводим в текст с помощью OCR. Особое внимание уделяем таблицам и договорам с приложениями. Документы могут поступать из общих сетевых папок, СЭД, SharePoint, почтовых архивов или вашего приложения, а новые и изменённые документы переиндексируются автоматически. Подключение нового источника обычно занимает несколько дней.

Покидают ли наши документы компанию?

Нет. Мы не используем внешние ИИ-сервисы — только собственные модели, работающие на нашей частной инфраструктуре в ЕС или на вашем сервере. Для юридических фирм, банков, медицины и госучреждений предлагаем установку on-prem, которая может работать полностью без интернета. Ваши документы не используются для обучения моделей других клиентов, а адаптированная модель принадлежит вашему проекту.

Какие ИИ-модели вы используете?

Мы используем собственные языковые и поисковые модели, дообученные под отрасль клиента: терминологию, сокращения и язык, на котором работает команда. Размер модели выбираем исходя из объёма документации, требуемой скорости и оборудования, на котором работает система. Всё решение собственное, поэтому вы не зависите от цен, правил и изменений иностранных ИИ-поставщиков. После завершения проекта модель и индекс могут работать и на вашем оборудовании.

Насколько точен поиск и что, если ИИ не знает ответа?

Точность мы измеряем на ваших реальных вопросах до внедрения: готовим набор вопросов с ожидаемыми ответами и проверяем, находит ли система нужные источники и правильно ли их толкует. Если надёжного ответа в документах нет, ассистент прямо сообщает об этом и показывает наиболее релевантные документы, а не угадывает. Поскольку у каждого ответа есть цитата, проверка занимает секунды.

Как система соблюдает права доступа?

Мы переносим права из системы, где уже хранятся документы, — СЭД, SharePoint или Active Directory — и проверяем их перед каждым поиском. Сотрудник получает ответы только из разрешённых ему документов, а конфиденциальные документы не попадают ни в цитаты, ни в резюме. Каждый запрос и ответ записываются, поэтому у администратора есть полный журнал аудита.

Работает ли система со сканами и таблицами?

Да. Отсканированные договоры, решения и протоколы переводятся в текст с помощью OCR, а таблицы сохраняют структуру, поэтому система отвечает и на вопросы о суммах, сроках и позициях. Качество зависит от скана: чёткие сканы дают отличный результат, а для плохих копий или рукописных пометок мы заранее оцениваем, что реально сделать. Рукописные пометки при необходимости помечаются для ручной проверки.

Сколько стоит ИИ-поиск по документам?

Пилот на одном массиве документов, например внутренних регламентах или договорах, стоит от 2 000 €. Полноценная база знаний компании с несколькими источниками, правами доступа, дообучением на вашей терминологии и ИИ-агентами для резюме и сравнения — от 5 000 €. Установка on-prem рассчитывается индивидуально. Ежемесячные расходы зависят от объёма документов, числа пользователей и места размещения системы.

Сколько времени занимает внедрение?

Пилот на ваших документах обычно готов за 4–6 недель: неделя на воркшоп и выбор документов, затем обработка, настройка модели и две недели пилотного использования с измерением точности. Расширение на всю компанию зависит от количества источников и интеграций и планируется после того, как пилот подтвердит результат. На протяжении всего процесса вы получаете еженедельные отчёты о ходе работ и точности.

Соответствует ли решение GDPR?

Да. Данные обрабатываются на серверах в ЕС или на вашей инфраструктуре, доступ ограничен уже существующими правами, а журнал запросов позволяет проводить аудит. Вместе с вами мы определяем, какие персональные данные обрабатывает система, сколько хранятся запросы и у кого есть права администратора — в соответствии с GDPR и местным законодательством о защите данных.

Покажите нам документы — мы покажем ответы

Запишитесь на бесплатный 30-минутный воркшоп. Мы посмотрим ваши документы и вопросы и предложим пилот с фиксированной ценой.