SKI
Uma interface de voz no dispositivo que permite que desenvolvedores falem com agentes de codificação como Claude Code e Codex e ouçam suas respostas.
Comunidade:
Visão Geral do Produto
O que é SKI?
O SKI transforma prompts digitados em conversas faladas para agentes de codificação. Em vez de digitar instruções e rolar pela saída, os desenvolvedores falam em voz alta com Claude Code, Cursor, Codex, Gemini CLI, Windsurf ou OpenClaw e ouvem a resposta do agente em uma voz sintetizada. Todo o processo — reconhecimento de fala e saída de voz — roda localmente no Mac ou PC do usuário, então nada do que é falado é transmitido a um servidor. Além da programação, o SKI também funciona como gravador de reuniões offline e, por meio do seu recurso pago AgentCall, pode enviar o agente a uma videochamada ao vivo como participante que fala ou como anotador silencioso.
Recursos Principais
Loop de voz totalmente no dispositivo
O reconhecimento de fala e a síntese de voz neural rodam ambos na máquina local, então nenhum áudio sai do dispositivo e o app continua funcionando offline.
Interrupção full-duplex (Barge-In)
O cancelamento de eco permite que os usuários falem por cima do agente no meio de uma resposta e ainda assim sejam ouvidos com clareza, eliminando a necessidade de controles push-to-talk.
Roteamento entre agentes e múltiplos projetos
Uma única integração se conecta a vários agentes de codificação ao mesmo tempo, com cada projeto vinculado falando em sua própria voz distinta para facilitar a troca.
Status em tempo real e aprovação antes de enviar
Um indicador em tempo real confirma que o agente está ouvindo ativamente, enquanto um modo de revisão opcional mantém as transcrições em um balão editável até o usuário confirmar o envio.
Captura de screenshot sob demanda
Um atalho de teclado anexa uma captura de tela à próxima solicitação falada, e o agente também pode solicitar sua própria captura de tela quando precisar de contexto visual.
Gravador de reuniões offline com entrada automática pelo calendário
Captura o microfone e o áudio do sistema localmente, sem limite de duração e sem a necessidade de um bot entrar na chamada, além de poder enviar automaticamente o agente para reuniões vinculadas ao calendário.
Casos de Uso
- Sessões de programação com mãos livres : Desenvolvedores dão instruções de código por voz e ouvem os resultados narrados em vez de ler a saída do terminal.
- Alternância de tarefas entre múltiplos repositórios : Engenheiros que gerenciam vários repositórios de código falam com o projeto certo por voz, usando a voz distinta de cada projeto como pista sonora.
- Transcrição local de reuniões : Equipes gravam stand-ups, revisões ou chamadas com clientes inteiramente no dispositivo local e exportam a transcrição sem depender de um serviço de transcrição em nuvem.
- Compartilhamento de contexto visual : Desenvolvedores combinam uma solicitação falada com uma captura de tela instantânea para que o agente veja exatamente o que está na tela antes de agir.
- Acessibilidade com foco em voz : Desenvolvedores que preferem falar em vez de digitar, ou que têm capacidade limitada de digitação, podem desenvolver e depurar software de forma conversacional.
- Participação do agente de IA em reuniões : Por meio do AgentCall, o agente de codificação entra em uma chamada do Zoom, Meet ou Teams para falar, apresentar ou fazer anotações discretamente em nome da equipe.
Perguntas Frequentes
Alternativas ao SKI
ElevenLabs
Plataforma avançada baseada em IA especializada em texto para fala realista, fala para texto, clonagem de voz e agentes conversacionais em vários idiomas.
Cursor
Editor de código com IA baseado no VS Code que acelera o desenvolvimento de software com geração inteligente de código, refatoração e compreensão contextual da base de código.
Truecaller
Um dos principais aplicativos globais de identificação de chamadas e bloqueio de spam que utiliza IA e dados da comunidade para identificar chamadas, bloquear spam e aumentar a segurança da comunicação.
Xiaomi MiMo
O conjunto de modelos de agentes full-stack da Xiaomi, abrangendo raciocínio de ponta, percepção omnimodal e síntese de voz expressiva — construído para a era dos agentes.
Sesame AI
Modelo de voz com IA avançada, entregando síntese de fala natural, expressiva e sensível ao contexto.
Deepgram
Uma plataforma líder em voz IA que oferece capacidades de speech-to-text, text-to-speech e speech-to-speech para desenvolvedores.
SoundHound AI
Plataforma avançada de voz AI que oferece experiências conversacionais altamente precisas e personalizáveis, com IA generativa integrada e reconhecimento de músicas.
Cartesia AI
A plataforma de voz com IA mais rápida e ultra-realista, permitindo síntese, clonagem e preenchimento de voz em tempo real com alta fidelidade e baixa latência.

