Суверенный AI · В промышленной эксплуатации

Homan Transcribe: корпоративная транскрибация на своём сервере

Компания получает собственную точку транскрибации для Homan и других систем: аудио распознаёт локальная модель на сервере компании, а код опубликован для проверки и собственной сборки.

Что получил бизнес

Homan Transcribe Server – корпоративный сервис транскрибации с опубликованным исходным кодом. Он принимает встречи и звонки через защищённый API и распознаёт речь локальной моделью Whisper на сервере компании. ИТ-служба может проверить маршруты аудио, авторизацию и предусмотренные сетевые зависимости, а затем использовать готовое развёртывание или собрать собственную версию.

Что изменилось после внедрения

Разговоры остаются под контролем

Аудио распознаёт локальная модель на собственном сервере с видеокартой, без обязательной передачи записи внешнему AI-провайдеру.

Один сервис для разных систем

К защищённому API можно подключить Homan, телефонию, архив записей или другое внутреннее приложение компании.

Длинная встреча передаётся одним заданием

Homan отправляет только участки с речью, а сервер эффективно обрабатывает их без множества отдельных обращений для каждой короткой реплики.

Код и развёртывание доступны для аудита

Исходный код, описание API и конфигурация развёртывания опубликованы. ИТ-служба может проверить маршруты API, авторизацию, сетевые зависимости и работу с временными файлами либо собрать свой контейнер.

Зачем компании собственная транскрибация

Записи встреч и звонков содержат коммерческие условия, персональные данные и внутренние решения. Передача таких материалов стороннему облачному сервису подходит не каждой компании.

Homan Transcribe переносит распознавание речи на сервер с видеокартой под контролем организации. Готовый API становится внутренним сервисом, которым могут пользоваться разные рабочие приложения.

  • деловые встречи
  • записи звонков
  • интервью и голосовые заметки
  • внутренние аудиоархивы

Как сервер работает с Homan

Homan заранее отделяет звук микрофона от системного аудио и находит участки с речью. Один пакетный запрос передаёт эти фрагменты вместе с их источником и положением на временной шкале.

Сервер объединяет короткие реплики для эффективного распознавания, а затем возвращает каждый результат на его место. Если соответствие нельзя определить надёжно, спорный фрагмент обрабатывается отдельно.

  • один пакет на встречу
  • сохранение известных ролей дорожек
  • автоматическое определение языка
  • временная привязка результата
  • безопасная повторная обработка спорных фрагментов

Сервер сохраняет роли заранее разделённых дорожек Homan, а не определяет каждого участника разговора по голосу.

Как подключаются другие системы

Для телефонии, архивов и внутренних приложений предусмотрен отдельный маршрут транскрибации одного файла. Он принимает распространённые аудиоформаты и может вернуть JSON, обычный текст, SRT или VTT.

Контракт описан в OpenAPI, поэтому интеграция не зависит от скрытого клиентского приложения. Конкретный следующий шаг – поиск по разговорам, подготовка выжимки или передача результата в учётную систему – проектируется отдельно под процесс компании.

  • защищённый HTTP API
  • автоматическое определение языка
  • текст и временные метки
  • форматы JSON, TXT, SRT и VTT

Что даёт опубликованный исходный код

Homan Transcribe распространяется как open source: полный исходный код сервера, описание API и контейнерная конфигурация опубликованы на GitHub по лицензии MIT. Заказчик или независимый аудитор может изучить маршруты API, авторизацию, сетевые зависимости и работу с временными файлами.

Для максимального контроля компания может собрать свою версию контейнера и проверить её в выбранном контуре. Это уменьшает зависимость от одного поставщика, но не отменяет обычную защиту рабочей среды: сеть, ключи доступа, обновления и журналы по-прежнему настраиваются под требования компании.

  • полный исходный код на GitHub
  • формальный контракт OpenAPI
  • схема пакетного запроса
  • сценарии сборки и развёртывания
  • лицензия MIT

Что настраивается под конкретную компанию

Для конкретной компании при проектировании развёртывания фиксируются подходящая модель и языковое покрытие. Также настраиваются место размещения, доступ через внутреннюю сеть или VPN, сервисные ключи, аудит запросов, допустимая нагрузка, срок хранения служебных данных и интеграция с действующими системами.

Техническим специалистам

Сервис построен на C++ и whisper.cpp, использует Whisper large-v3-turbo с Vulkan-ускорением, FFmpeg для декодирования, Caddy для HTTPS и Docker Compose для развёртывания по опубликованной конфигурации.

  • Bearer-аутентификация на рабочих маршрутах
  • контейнеры только для чтения и без лишних Linux-привилегий
  • лимиты размера запроса, количества и длительности фрагментов
  • временные аудиофайлы удаляются после декодирования
  • OpenAPI 3.1 и JSON Schema для проверки интеграции

Стек: C++, whisper.cpp, Whisper large-v3-turbo, Vulkan, FFmpeg, Docker Compose, Caddy, OpenAPI, JSON Schema

Материалы по теме

Практические разборы внедрения, безопасности и работы с корпоративными данными.

Вопросы о решении

Аудио отправляется внешнему AI-провайдеру?

В описанном локальном развёртывании аудио передаётся на сервер под контролем компании и распознаётся локальной моделью, без внешнего AI-провайдера. Доступ к самому серверу, обновления и мониторинг настраиваются отдельно.

Можно ли использовать сервер без Homan?

Да. Отдельный маршрут принимает один аудиофайл и подходит для интеграции с телефонией, архивом или другим внутренним приложением.

Можно ли проверить, куда сервис передаёт аудио?

Да. Опубликованный код позволяет изучить предусмотренные сетевые зависимости и путь данных. ИТ-служба может самостоятельно собрать сервис и проверить конкретную версию в нужном контуре; публикация кода не заменяет такой аудит развёртывания.

Можно ли развернуть сервис во внутренней сети?

Да. Схема доступа, сеть, VPN, ключи, аудит и вычислительный профиль настраиваются под инфраструктуру и требования конкретной компании.

Обсудить похожую задачу

Опишите текущий процесс, данные и программы, которыми пользуются сотрудники. Я предложу понятный следующий шаг.