Gradium
超低延迟语音 AI 平台,通过统一 API 和按积分计费提供流式文本转语音、语音转文本和语音克隆服务。
社区:
产品概览
什么是Gradium?
Gradium 是一家总部位于巴黎的语音 AI 平台,脱胎于 Kyutai 研究实验室,面向需要实时、自然语音交互的开发者。该平台将文本转语音(TTS)、语音转文本(STT)、语音克隆和实时语音到语音翻译整合进同一套 API 体系,并针对 WebSocket 流式传输做了优化。据第三方基准测试,Gradium 的 TTS 模型首字节音频延迟低于 250ms,适合语音 Agent 及对话式应用场景。该服务采用灵活的积分计费模式,提供慷慨的免费额度,可从个人开发者一路扩展到企业级定制部署。
主要功能
超低延迟流式 TTS
基于 WebSocket 的文本转语音 API,首字节音频延迟约 216-235ms,支持增量音频流式传输,为 Agent 和应用带来自然的实时语音交互体验。
带语义 VAD 的实时语音转文本
流式 STT API 具备语义级语音活动检测能力,能智能识别说话边界,减少误识别,提升语音 Agent 场景下的转写准确率。
即时与专业级语音克隆
REST API 支持仅用 10 秒音频即可完成零样本语音克隆(付费计划每月最多 1,000 次克隆),M/L 档位还提供经过微调的 Professional Voice Cloning,音色还原度更高。
统一的按积分计费体系
TTS、STT、语音克隆共用同一个积分池,共六档套餐,从 Free(每月 45,000 积分)到 Enterprise 均可选,超出额度按有竞争力的单价计费。
多语言与端侧支持
核心语音能力覆盖英语、法语、西班牙语、葡萄牙语和德语,并提供 Phonon 端侧 TTS SDK(1 亿参数),可离线部署于移动端,在 Seed-TTS 基准测试中词错率仅 1.00%。
实时语音到语音翻译
实时翻译 API 可将一种语言的语音直接转换为另一种语言的合成语音,适用于跨语言语音 Agent 及沟通类应用。
使用场景
- 语音 Agent 与对话式 AI : 凭借低于 250ms 的 TTS 延迟和语义 VAD,构建响应迅速、交互自然的 AI 助手与聊天机器人,实现流畅的轮次切换、减少对话空档。
- 实时转写服务 : 为会议、播客或客服通话部署实时转写,流式 STT 支持自定义词表和多语种混说场景下的语言切换识别。
- 个性化语音体验 : 通过短样本的即时克隆或经微调的专业模型,为有声书、游戏 NPC 或客服机器人打造专属或品牌化的语音克隆。
- 多语言内容本地化 : 面向支持的五种语言进行翻译与合成,服务全球用户;也可使用实时语音到语音翻译实现跨语言实时沟通。
- 离线与边缘端语音应用 : 为移动应用、物联网设备或对隐私要求高的场景部署 Phonon 端侧 TTS SDK,无需调用 API 即可离线完成语音合成,无延迟顾虑。
- 开发者原型验证与规模化 : 先用每月 45,000 免费积分做测试,再从 XS 一路扩展到 Enterprise,积分定价可预测,超额部分按量付费应对突发流量。
常见问题
Gradium的替代方案
ElevenLabs
先进的AI驱动平台,专注于多语言仿真文本转语音、语音转文本、声音克隆和对话式语音Agent。
Speechify
AI驱动的文本转语音平台,提供自然人声、语音克隆及多媒体内容创作工具。
Cartesia AI
最快速的超逼真语音AI平台,实现高保真、低时延的实时语音合成、克隆与补全。
Deepgram
领先的语音AI平台,为开发者提供语音转文本、文本转语音和语音到语音能力。
FineVoice
一个多功能语音创作平台,可将文本转换为语音、克隆声音、变换声音,并生成涵盖154+种语言的音效。
Resemble AI
企业级AI语音平台,提供极速语音克隆、情感定制、深度伪造检测及多语言支持,助力打造安全可扩展的语音应用。
CoeFont CLOUD
全球AI语音枢纽,提供多语言、自然流畅的文本转语音、语音创作与转换解决方案。
AnySpeech
基于Web的语音平台,提供文字转语音、语音克隆和语音转录功能,支持100多种语音和50多种语言。

