SKI
Локальный голосовой интерфейс, который позволяет разработчикам разговаривать с кодинг-агентами вроде Claude Code и Codex и слышать их ответы.
Сообщество:
Обзор продукта
Что такое SKI?
SKI превращает текстовые промпты в голосовой диалог для кодинг-агентов. Вместо того чтобы печатать инструкции и прокручивать вывод, разработчики обращаются голосом к Claude Code, Cursor, Codex, Gemini CLI, Windsurf или OpenClaw и слышат ответ агента синтезированным голосом. Весь цикл — распознавание речи и голосовой вывод — выполняется локально на Mac или PC пользователя, поэтому ничего из сказанного никогда не передаётся на сервер. Помимо кодинга, SKI также работает как офлайн-рекордер встреч, а через платную функцию AgentCall может отправлять агента в живой видеозвонок в роли говорящего участника или тихого протоколиста.
Ключевые функции
Полностью локальный голосовой цикл
Распознавание речи и нейросетевой синтез голоса выполняются локально на устройстве, поэтому звук никогда не покидает устройство, а приложение продолжает работать офлайн.
Полнодуплексное прерывание (Barge-In)
Подавление эха позволяет пользователю перебивать агента прямо во время его ответа и быть чётко услышанным, устраняя необходимость в кнопке push-to-talk.
Маршрутизация между агентами и проектами
Одна интеграция подключается сразу к нескольким кодинг-агентам, при этом каждый привязанный проект говорит своим собственным голосом для удобного переключения.
Статус в реальном времени и подтверждение перед отправкой
Индикатор в реальном времени подтверждает, что агент активно слушает, а опциональный режим проверки удерживает расшифровку в редактируемом облачке, пока пользователь не подтвердит отправку.
Захват скриншота по запросу
Горячая клавиша прикрепляет скриншот к следующему голосовому запросу, а сам агент также может запросить скриншот, когда ему нужен визуальный контекст.
Офлайн-запись встреч с автоприсоединением по календарю
Локально захватывает звук с микрофона и системный аудиопоток без ограничения по длительности, без необходимости присоединения бота к звонку, а также может автоматически отправлять агента на встречи, связанные с календарём.
Варианты использования
- Кодинг-сессии без использования рук : Разработчики отдают инструкции по коду голосом и слышат результаты в виде озвученного рассказа вместо чтения вывода терминала.
- Переключение задач между несколькими репозиториями : Инженеры, работающие с несколькими кодовыми базами, обращаются к нужному проекту голосом, используя уникальный голос каждого проекта как звуковую подсказку.
- Локальная транскрипция встреч : Команды записывают стендапы, ревью или звонки с клиентами полностью локально и экспортируют расшифровку, не полагаясь на облачный сервис транскрипции.
- Обмен визуальным контекстом : Разработчики сопровождают голосовой запрос мгновенным скриншотом, чтобы агент точно видел, что происходит на экране, прежде чем действовать.
- Голосовая доступность в приоритете : Разработчики, предпочитающие говорить, а не печатать, или имеющие ограниченные возможности набора текста, могут разрабатывать и отлаживать программное обеспечение в диалоговом формате.
- Участие AI-агента во встречах : Через AgentCall кодинг-агент присоединяется к звонку в Zoom, Meet или Teams, чтобы говорить, презентовать или тихо вести заметки от имени команды.
Часто задаваемые вопросы
Альтернативы SKI
ElevenLabs
Продвинутая AI-платформа для живого синтеза речи, распознавания речи, клонирования голоса и голосовых агентов на разных языках.
Cursor
AI-редактор кода на базе VS Code, ускоряющий разработку ПО с помощью интеллектуальной генерации кода, рефакторинга и контекстного понимания кодовой базы.
Truecaller
Ведущее мировое приложение для определения номера и блокировки спама, использующее AI и данные сообщества для идентификации звонков, блокировки спама и повышения безопасности коммуникаций.
Xiaomi MiMo
Полностековый набор агентных моделей Xiaomi, охватывающий передовые рассуждения, мультимодальное восприятие и выразительный синтез речи — созданный для эпохи агентов.
Sesame AI
Продвинутая AI-модель голоса, обеспечивающая естественный, выразительный и контекстно-зависимый синтез речи.
Deepgram
Ведущая голосовая AI-платформа, предоставляющая возможности speech-to-text, text-to-speech и speech-to-speech для разработчиков.
SoundHound AI
Передовая платформа голосового AI, обеспечивающая точные, настраиваемые диалоговые решения с интеграцией generative AI и распознаванием музыки.
Cartesia AI
Самая быстрая ультрареалистичная голосовая AI-платформа с поддержкой синтеза, клонирования и инфиллинга голоса в реальном времени с высокой точностью и низкой задержкой.

