icon of Noveum.ai

Noveum.ai

闭环评估平台,为生产环境中的聊天、语音和工作流 AI Agent 提供追踪、评分,并交付经过验证的修复。

社区:

产品概览

什么是Noveum.ai?

Noveum.ai preview

Noveum.ai 是一个面向在生产环境中运行 AI Agent 的工程团队的 Agent 评估与修复平台。它不止步于标记失败:通过开源 SDK 捕获每一次 LLM 调用、工具调用和 Agent 步骤,使用 100 多个校准评分器为运行结果打分,并借助 NovaPilot 引擎生成候选修复方案。每个修复都会针对失败的调用进行回测,并经过端到端重新模拟,之后 Noveum 才会将其作为 pull request 提交,供人工审核并合并。平台支持聊天、语音和多步骤工作流 Agent,深度集成 LangChain、LangGraph、LiveKit、Pipecat 和 CrewAI 等框架,并为有严格数据驻留要求的企业提供本地部署或自带 ClickHouse 的部署方式。


主要功能

  • NovaTrace 可观测性

    开源 SDK 可捕获每一次 LLM 调用、工具调用、检索和 Agent 步骤,并在每个 span 上记录 token、成本和延迟数据,与 OpenTelemetry 对齐。

  • 100+ 校准评分器

    生产环境的 trace 会被自动采样,并由大量预调优的评分器进行评估,无需手动整理数据集。

  • NovaPilot 自动修复

    将失败追溯到根因,生成候选修复方案,并通过回测和完整的重新模拟验证后,再提交 pull request。

  • 多 Agent 框架支持

    原生集成 LangChain、LangGraph、LiveKit、Pipecat 和 CrewAI,覆盖聊天、语音和多步骤工作流 Agent 架构。

  • 企业级部署控制

    支持本地部署、VPC 或自带 ClickHouse 部署,提供 SSO/SAML、RBAC 和审计日志,SOC 2 Type II 认证正在进行中,并符合 GDPR 合规要求。

  • 高吞吐追踪

    经压力测试可达每秒 15,000 个 span,在生产环境中每天处理超过 6000 万个 span。


使用场景

  • 语音 Agent 调试 : 团队在真实通话中测试语音 Agent,使用专用语音评分器为对话打分,并在发布前通过生产级模拟验证修复效果。
  • 聊天 Agent 质量保障 : 将生产环境的聊天 trace 转化为可直接运行的评估,无需手动构建测试数据集或挑选评分器。
  • 工作流 Agent 监控 : 对多步骤 Agent 的工具调用、路由决策和端到端结果进行评估,发现步骤之间产生的故障。
  • 受监管行业部署 : 金融服务、电信和房地产团队在本地或使用自有 ClickHouse 实例运行 Noveum,让 trace 数据留在自己的基础设施内。
  • 告别手动调试 : 团队不再手动翻看日志、把 trace 复制粘贴到其他 AI 工具,而是直接在同一平台内分析 span、trace 和修复建议。

常见问题

Noveum.ai网站分析