Gradium
통합 API와 크레딧 기반 요금제를 통해 스트리밍 텍스트 음성 변환, 음성 인식, 음성 복제를 제공하는 초저지연 음성 AI 플랫폼입니다.
커뮤니티:
제품 개요
Gradium이란 무엇인가요?
Gradium은 Kyutai 연구소에서 스핀오프한 파리 기반 음성 AI 플랫폼으로, 실시간의 자연스러운 음성 상호작용이 필요한 개발자를 위해 만들어졌습니다. 이 플랫폼은 텍스트 음성 변환(TTS), 음성 인식(STT), 음성 복제, 실시간 음성-음성 번역을 하나의 API 스택으로 통합했으며, WebSocket 스트리밍에 최적화되어 있습니다. Gradium의 TTS 모델은 독립 벤치마크에서 250ms 미만의 첫 오디오 응답 시간을 달성해 음성 에이전트 및 대화형 애플리케이션에 적합합니다. 이 서비스는 유연한 크레딧 기반 시스템으로 운영되며, 넉넉한 무료 티어를 제공하고 개인 개발자부터 커스텀 요금제의 엔터프라이즈 배포까지 확장 가능합니다.
주요 기능
초저지연 스트리밍 TTS
WebSocket 기반 텍스트 음성 변환 API로 약 216-235ms의 첫 오디오 응답 시간(time-to-first-audio)을 구현하며, 점진적 오디오 스트리밍을 통해 에이전트와 애플리케이션에 자연스러운 실시간 음성 상호작용을 제공합니다.
시맨틱 VAD 기반 실시간 음성 인식(STT)
발화 경계를 지능적으로 감지하는 시맨틱 음성 활동 감지(VAD) 기능을 갖춘 스트리밍 STT API로, 오탐 전사를 줄이고 음성 에이전트 워크플로우의 정확도를 높입니다.
즉시 및 전문가급 음성 복제
10초 분량의 오디오만으로 제로샷 음성 복제가 가능한 REST API(유료 플랜에서 월 최대 1,000회 복제)와, M·L 등급에서 더 높은 화자 유사도를 제공하는 파인튜닝 기반 Professional Voice Cloning을 지원합니다.
통합 크레딧 기반 요금제
TTS, STT, 음성 복제 전 서비스가 하나의 크레딧 풀을 공유하며, Free(월 45,000크레딧)부터 Enterprise까지 6단계 요금제와 경쟁력 있는 단가의 종량제 초과 사용 옵션을 제공합니다.
다국어 및 온디바이스 지원
영어, 프랑스어, 스페인어, 포르투갈어, 독일어의 핵심 음성 기능을 지원하며, 오프라인 모바일 배포용 Phonon 온디바이스 TTS SDK(1억 파라미터)는 Seed-TTS 벤치마크 기준 WER 1.00%를 기록합니다.
실시간 음성-음성 번역
한 언어로 발화된 오디오를 다른 언어의 합성 음성으로 실시간 변환하는 번역 API로, 다국어 음성 에이전트 및 커뮤니케이션 애플리케이션을 지원합니다.
사용 사례
- 음성 에이전트 및 대화형 AI : 250ms 미만의 TTS 지연 시간과 시맨틱 VAD를 활용해 자연스러운 음성 상호작용이 가능한 반응형 AI 어시스턴트와 챗봇을 구축하고, 매끄러운 턴 전환과 대화 공백 감소를 실현합니다.
- 실시간 전사 서비스 : 회의, 팟캐스트, 고객 지원 통화를 위한 실시간 전사를 스트리밍 STT로 구축하며, 사용자 지정 어휘와 다국어 화자를 위한 코드 스위칭을 지원합니다.
- 개인화된 음성 경험 : 짧은 샘플의 즉시 복제 또는 파인튜닝된 전문 모델을 활용해 오디오북, 게임 NPC, 고객 서비스 봇용 브랜드 맞춤형 음성 복제를 제작합니다.
- 다국어 콘텐츠 현지화 : 지원되는 5개 언어로 콘텐츠를 번역·합성해 글로벌 사용자에게 제공하거나, 실시간 음성-음성 번역으로 실시간 다국어 소통 도구를 구현합니다.
- 오프라인 및 엣지 음성 애플리케이션 : API 호출이나 지연 걱정 없이 오프라인 음성 합성이 필요한 모바일 앱, IoT 기기, 개인정보 민감 애플리케이션에 Phonon 온디바이스 TTS SDK를 배포합니다.
- 개발자 프로토타이핑 및 스케일링 : 월 45,000 무료 크레딧으로 테스트를 시작한 뒤, XS부터 Enterprise까지 예측 가능한 크레딧 요금제와 종량제 초과 옵션으로 불규칙한 사용량 급증에도 대응하며 확장합니다.
자주 묻는 질문
Gradium 대안
ElevenLabs
사실적인 텍스트-투-스피치, 스피치-투-텍스트, 음성 복제, 대화형 보이스 에이전트 등 다양한 언어를 지원하는 고급 AI 기반 플랫폼입니다.
Speechify
AI 기반 자연스러운 음성, 음성 클로닝, 멀티미디어 콘텐츠 제작 도구를 제공하는 텍스트-음성 변환 플랫폼입니다.
Cartesia AI
초고속, 초현실적인 음성 AI 플랫폼으로, 실시간 음성 합성, 클로닝, 인필링을 고음질과 저지연으로 제공합니다.
Deepgram
Speech-to-Text, Text-to-Speech, Speech-to-Speech 기능을 제공하는 선도적인 음성 AI 플랫폼입니다.
FineVoice
텍스트를 음성으로 변환하고, 음성을 복제하며, 음성을 변환하고, 154개 이상의 언어로 효과음을 생성하는 다목적 음성 제작 플랫폼입니다.
Resemble AI
기업용 AI 음성 플랫폼으로 빠른 음성 복제, 감정 커스터마이징, 딥페이크 탐지, 다국어 지원 등 안전하고 확장 가능한 음성 애플리케이션을 제공합니다.
CoeFont CLOUD
다국어, 자연스러운 텍스트-투-스피치, 음성 생성 및 음성 변환 솔루션을 제공하는 글로벌 AI 음성 허브.
AnySpeech
100개 이상의 음성과 50개 이상의 언어를 지원하는 텍스트 음성 변환, 음성 복제 및 음성 전사 기능을 제공하는 웹 기반 음성 플랫폼입니다.

