SKI
開発者がClaude CodeやCodexなどのコーディングエージェントに話しかけ、その応答を音声で聞くことができるオンデバイス音声インターフェースです。
コミュニティ:
製品概要
SKIとは?
SKIは、コーディングエージェント向けのテキストプロンプトを音声での会話に変換します。指示を入力して出力をスクロールして読む代わりに、開発者はClaude Code、Cursor、Codex、Gemini CLI、Windsurf、OpenClawに向かって声で話しかけ、エージェントの応答を合成音声で聞くことができます。音声認識と音声出力を含む一連の処理はすべてユーザーのMacまたはPC上でローカルに実行されるため、発話内容がサーバーに送信されることはありません。コーディング用途に加えて、SKIはオフライン会議レコーダーとしても使え、有料機能のAgentCallを通じて、エージェントを発言参加者または静かな議事録係としてライブビデオ通話に参加させることもできます。
主な機能
完全オンデバイスの音声ループ
音声認識とニューラル音声合成はどちらもローカルマシン上で実行されるため、音声が外部に送信されることはなく、オフラインでも動作し続けます。
フルデュプレックスのバージイン(割り込み発話)
エコーキャンセレーションにより、エージェントの応答中でもユーザーが話しかけて割り込むことができ、正確に認識されるため、プッシュトゥトーク操作は不要です。
クロスエージェント・マルチプロジェクトルーティング
1つの連携で複数のコーディングエージェントに同時接続でき、紐づけられた各プロジェクトごとに固有の音声が割り当てられ、簡単に切り替えられます。
リアルタイムステータス表示と送信前承認
リアルタイムインジケーターがエージェントが聞き取り中であることを示し、任意のレビューモードでは、ユーザーが送信を確定するまで文字起こしを編集可能な吹き出しに保持します。
オンデマンドスクリーンショット取得
ホットキーで次の音声リクエストにスクリーンショットを添付でき、エージェント側からも視覚的な文脈が必要な際に自らスクリーンショットを要求できます。
オフライン会議録音とカレンダー自動参加
マイクとシステム音声を時間無制限でローカルに録音し、ボットが通話に参加する必要がなく、カレンダーに紐づいた会議へエージェントを自動的に参加させることもできます。
ユースケース
- ハンズフリーのコーディングセッション : 開発者は音声でコーディング指示を出し、ターミナル出力を読む代わりに結果を音声で聞きます。
- 複数リポジトリ間のタスク切り替え : 複数のコードベースを管理するエンジニアは音声で目的のプロジェクトを指定し、プロジェクトごとに異なる音声を音声的な手がかりとして利用します。
- ローカルでの会議文字起こし : チームはスタンドアップ、レビュー、顧客との通話をすべてローカルで録音し、クラウドの文字起こしサービスに頼らず文字起こしをエクスポートできます。
- 視覚的コンテキストの共有 : 開発者は音声リクエストにその場でスクリーンショットを添えることで、エージェントが実行前に画面の内容を正確に把握できるようにします。
- 音声ファーストのアクセシビリティ : タイピングより発話を好む開発者や、タイピングに制約のある開発者も、会話形式でソフトウェアの開発とデバッグを行えます。
- AIエージェントの会議参加 : AgentCallを通じて、コーディングエージェントがZoom、Meet、Teamsの通話に参加し、発言やプレゼンテーション、あるいはチームの代わりに静かに議事録を取ることができます。
よくある質問
SKIの代替品
ElevenLabs
多言語対応のリアルなテキスト読み上げ、音声認識、ボイスクローン、会話型音声エージェントに特化した先進的なAIプラットフォームです。
Cursor
AIによるコード生成、リファクタリング、コンテキスト理解を備えたVS Codeベースの高速コーディングエディタ。
Truecaller
AIとコミュニティデータを活用して発信者を識別し、スパムをブロックし、コミュニケーションの安全性を高める、世界をリードする発信者ID&スパムブロックアプリ。
Xiaomi MiMo
最先端の推論、全モーダル認識、表現豊かな音声合成を網羅する Xiaomi のフルスタックエージェントモデルスイート — エージェント時代のために構築されました。
Sesame AI
自然で表現力豊か、文脈に応じた会話型音声合成を実現する先進的なAI音声モデルです。
Deepgram
開発者向けにSpeech-to-Text、Text-to-Speech、Speech-to-Speech機能を提供するリーディング音声AIプラットフォームです。
SoundHound AI
高度な音声AIプラットフォームで、生成AIと音楽認識を統合し、正確でカスタマイズ可能な会話体験を提供します。
Cartesia AI
超高速・超リアルな音声AIプラットフォーム。高忠実度・低遅延でリアルタイム音声合成、クローン、インフィリングを実現。

