Noveum.ai
闭环评估平台,为生产环境中的聊天、语音和工作流 AI Agent 提供追踪、评分,并交付经过验证的修复。
社区:
产品概览
什么是Noveum.ai?
Noveum.ai 是一个面向在生产环境中运行 AI Agent 的工程团队的 Agent 评估与修复平台。它不止步于标记失败:通过开源 SDK 捕获每一次 LLM 调用、工具调用和 Agent 步骤,使用 100 多个校准评分器为运行结果打分,并借助 NovaPilot 引擎生成候选修复方案。每个修复都会针对失败的调用进行回测,并经过端到端重新模拟,之后 Noveum 才会将其作为 pull request 提交,供人工审核并合并。平台支持聊天、语音和多步骤工作流 Agent,深度集成 LangChain、LangGraph、LiveKit、Pipecat 和 CrewAI 等框架,并为有严格数据驻留要求的企业提供本地部署或自带 ClickHouse 的部署方式。
主要功能
NovaTrace 可观测性
开源 SDK 可捕获每一次 LLM 调用、工具调用、检索和 Agent 步骤,并在每个 span 上记录 token、成本和延迟数据,与 OpenTelemetry 对齐。
100+ 校准评分器
生产环境的 trace 会被自动采样,并由大量预调优的评分器进行评估,无需手动整理数据集。
NovaPilot 自动修复
将失败追溯到根因,生成候选修复方案,并通过回测和完整的重新模拟验证后,再提交 pull request。
多 Agent 框架支持
原生集成 LangChain、LangGraph、LiveKit、Pipecat 和 CrewAI,覆盖聊天、语音和多步骤工作流 Agent 架构。
企业级部署控制
支持本地部署、VPC 或自带 ClickHouse 部署,提供 SSO/SAML、RBAC 和审计日志,SOC 2 Type II 认证正在进行中,并符合 GDPR 合规要求。
高吞吐追踪
经压力测试可达每秒 15,000 个 span,在生产环境中每天处理超过 6000 万个 span。
使用场景
- 语音 Agent 调试 : 团队在真实通话中测试语音 Agent,使用专用语音评分器为对话打分,并在发布前通过生产级模拟验证修复效果。
- 聊天 Agent 质量保障 : 将生产环境的聊天 trace 转化为可直接运行的评估,无需手动构建测试数据集或挑选评分器。
- 工作流 Agent 监控 : 对多步骤 Agent 的工具调用、路由决策和端到端结果进行评估,发现步骤之间产生的故障。
- 受监管行业部署 : 金融服务、电信和房地产团队在本地或使用自有 ClickHouse 实例运行 Noveum,让 trace 数据留在自己的基础设施内。
- 告别手动调试 : 团队不再手动翻看日志、把 trace 复制粘贴到其他 AI 工具,而是直接在同一平台内分析 span、trace 和修复建议。
常见问题
Noveum.ai的替代方案
Coval
自动化仿真与评估平台,加速高可靠AI语音与聊天Agent开发。
Relari AI
一站式平台,基于合约驱动,可通过合成数据与模块化评测对复杂生成式AI应用进行仿真、测试与验证。
Bytebot
开源桌面自动化Agent,通过自然语言命令在容器化Linux环境中执行复杂的多步骤工作流。
Plurai
面向 AI Agent 的真实世界信任平台,融合仿真、评估与护栏能力,助力 Agent 从原型走向可靠的生产环境。
Polarity
为 AI Agent 打造的沙箱评估基础设施,基于真实后端服务构建,以发现提示级工具遗漏的故障模式。
Casco
为开发者提供AI应用和智能体威胁检测、验证与缓解的安全平台。
Maxim AI
端到端AI评测与可观测性平台,加速可靠AI Agent的开发与部署。
Penligent
一个自主渗透测试平台,在统一的安全生态系统中结合漏洞检测、漏洞利用自动化和智能红队功能。

