Разговоры остаются под контролем
Аудио распознаёт локальная модель на собственном сервере с видеокартой, без обязательной передачи записи внешнему AI-провайдеру.
Суверенный AI · В промышленной эксплуатации
Компания получает собственную точку транскрибации для Homan и других систем: аудио распознаёт локальная модель на сервере компании, а код опубликован для проверки и собственной сборки.
Результат
Homan Transcribe Server – корпоративный сервис транскрибации с опубликованным исходным кодом. Он принимает встречи и звонки через защищённый API и распознаёт речь локальной моделью Whisper на сервере компании. ИТ-служба может проверить маршруты аудио, авторизацию и предусмотренные сетевые зависимости, а затем использовать готовое развёртывание или собрать собственную версию.
Ценность
Аудио распознаёт локальная модель на собственном сервере с видеокартой, без обязательной передачи записи внешнему AI-провайдеру.
К защищённому API можно подключить Homan, телефонию, архив записей или другое внутреннее приложение компании.
Homan отправляет только участки с речью, а сервер эффективно обрабатывает их без множества отдельных обращений для каждой короткой реплики.
Исходный код, описание API и конфигурация развёртывания опубликованы. ИТ-служба может проверить маршруты API, авторизацию, сетевые зависимости и работу с временными файлами либо собрать свой контейнер.
Записи встреч и звонков содержат коммерческие условия, персональные данные и внутренние решения. Передача таких материалов стороннему облачному сервису подходит не каждой компании.
Homan Transcribe переносит распознавание речи на сервер с видеокартой под контролем организации. Готовый API становится внутренним сервисом, которым могут пользоваться разные рабочие приложения.
Homan заранее отделяет звук микрофона от системного аудио и находит участки с речью. Один пакетный запрос передаёт эти фрагменты вместе с их источником и положением на временной шкале.
Сервер объединяет короткие реплики для эффективного распознавания, а затем возвращает каждый результат на его место. Если соответствие нельзя определить надёжно, спорный фрагмент обрабатывается отдельно.
Сервер сохраняет роли заранее разделённых дорожек Homan, а не определяет каждого участника разговора по голосу.
Для телефонии, архивов и внутренних приложений предусмотрен отдельный маршрут транскрибации одного файла. Он принимает распространённые аудиоформаты и может вернуть JSON, обычный текст, SRT или VTT.
Контракт описан в OpenAPI, поэтому интеграция не зависит от скрытого клиентского приложения. Конкретный следующий шаг – поиск по разговорам, подготовка выжимки или передача результата в учётную систему – проектируется отдельно под процесс компании.
Homan Transcribe распространяется как open source: полный исходный код сервера, описание API и контейнерная конфигурация опубликованы на GitHub по лицензии MIT. Заказчик или независимый аудитор может изучить маршруты API, авторизацию, сетевые зависимости и работу с временными файлами.
Для максимального контроля компания может собрать свою версию контейнера и проверить её в выбранном контуре. Это уменьшает зависимость от одного поставщика, но не отменяет обычную защиту рабочей среды: сеть, ключи доступа, обновления и журналы по-прежнему настраиваются под требования компании.
Адаптация
Для конкретной компании при проектировании развёртывания фиксируются подходящая модель и языковое покрытие. Также настраиваются место размещения, доступ через внутреннюю сеть или VPN, сервисные ключи, аудит запросов, допустимая нагрузка, срок хранения служебных данных и интеграция с действующими системами.
Сервис построен на C++ и whisper.cpp, использует Whisper large-v3-turbo с Vulkan-ускорением, FFmpeg для декодирования, Caddy для HTTPS и Docker Compose для развёртывания по опубликованной конфигурации.
Стек: C++, whisper.cpp, Whisper large-v3-turbo, Vulkan, FFmpeg, Docker Compose, Caddy, OpenAPI, JSON Schema
Подробнее
Практические разборы внедрения, безопасности и работы с корпоративными данными.
Локальный помощник для встреч сохраняет разговор на Mac и готовит расшифровку, решения и следующие действия без обязательной передачи внешнему AI-провайдеру.
Читать материалЗапись звонка можно обработать внутри компании: получить текст со спикерами и таймкодами, выделить договорённости и подготовить черновики CRM и задач.
Читать материалAI может подготовить сводку, письмо, запись CRM или задачу, но не должен получать прямой полный доступ к базе. Безопасная схема отделяет предложение модели от исполняемого действия.
Читать материалПроект
В описанном локальном развёртывании аудио передаётся на сервер под контролем компании и распознаётся локальной моделью, без внешнего AI-провайдера. Доступ к самому серверу, обновления и мониторинг настраиваются отдельно.
Да. Отдельный маршрут принимает один аудиофайл и подходит для интеграции с телефонией, архивом или другим внутренним приложением.
Да. Опубликованный код позволяет изучить предусмотренные сетевые зависимости и путь данных. ИТ-служба может самостоятельно собрать сервис и проверить конкретную версию в нужном контуре; публикация кода не заменяет такой аудит развёртывания.
Да. Схема доступа, сеть, VPN, ключи, аудит и вычислительный профиль настраиваются под инфраструктуру и требования конкретной компании.
Обсудить задачу
Опишите текущий процесс, данные и программы, которыми пользуются сотрудники. Я предложу понятный следующий шаг.