Noveum.ai
閉環評估平台,為正式環境中的聊天、語音與工作流程 AI Agent 提供追蹤、評分,並交付經過驗證的修復。
社群:
產品概覽
Noveum.ai 是什麼?
Noveum.ai 是專為在正式環境中運行 AI Agent 的工程團隊打造的 Agent 評估與修復平台。它不只是標記失敗:透過開源 SDK 擷取每一次 LLM 呼叫、工具呼叫與 Agent 步驟,以 100 多個校準評分器為執行結果評分,並藉由 NovaPilot 引擎產生候選修復方案。每個修復都會針對失敗的呼叫進行回測,並經過端到端重新模擬,之後 Noveum 才會將其以 pull request 形式提交,交由人員審核並合併。平台支援聊天、語音與多步驟工作流程 Agent,深度整合 LangChain、LangGraph、LiveKit、Pipecat 與 CrewAI 等框架,並為有嚴格資料落地需求的企業提供地端或自備 ClickHouse 的部署方式。
主要功能
NovaTrace 可觀測性
開源 SDK 可擷取每一次 LLM 呼叫、工具呼叫、檢索和 Agent 步驟,並在每個 span 上記錄 token、成本與延遲資料,與 OpenTelemetry 對齊。
100+ 校準評分器
正式環境的 trace 會被自動取樣,並由大量預先調校的評分器進行評估,不需手動整理資料集。
NovaPilot 自動修復
將失敗追溯至根本原因,產生候選修復方案,並經由回測與完整的重新模擬驗證後,再提交 pull request。
多 Agent 框架支援
原生整合 LangChain、LangGraph、LiveKit、Pipecat 與 CrewAI,涵蓋聊天、語音及多步驟工作流程 Agent 架構。
企業級部署控管
支援地端部署、VPC 或自備 ClickHouse 部署,提供 SSO/SAML、RBAC 與稽核日誌,SOC 2 Type II 認證進行中,並符合 GDPR 規範。
高吞吐量追蹤
經負載測試可達每秒 15,000 個 span,在正式環境中每日處理超過 6,000 萬個 span。
使用案例
- 語音 Agent 除錯 : 團隊在真實通話中測試語音 Agent,使用專用語音評分器為對話評分,並在上線前透過正式環境等級的模擬驗證修復成效。
- 聊天 Agent 品質保證 : 將正式環境的聊天 trace 轉換為可直接執行的評估,不需手動建立測試資料集或挑選評分器。
- 工作流程 Agent 監控 : 針對多步驟 Agent 的工具呼叫、路由決策與端到端結果進行評估,找出發生在步驟之間的失敗。
- 受管制產業部署 : 金融服務、電信與房地產團隊在地端或使用自有 ClickHouse 執行個體運行 Noveum,讓 trace 資料留在自己的基礎架構內。
- 告別手動除錯 : 團隊不再手動檢視日誌、將 trace 複製貼上到其他 AI 工具,而是直接在同一個平台內分析 span、trace 與修復建議。
常見問題
Noveum.ai 的替代方案
Coval
加速可靠AI語音及聊天代理人開發的自動化模擬與評測平台。
Relari AI
以合約為核心,結合 Synthetic Data 與模組化評估,模擬、測試並驗證複雜生成式 AI 應用的平台。
Bytebot
開源桌面自動化Agent,透過自然語言指令在容器化Linux環境中執行複雜的多步驟工作流程。
Plurai
面向 AI Agent 的真實世界信任平台,整合模擬、評估與護欄,協助 Agent 從原型走向可靠的正式環境。
Polarity
為 AI Agent 打造的沙箱評估基礎設施,基於真實後端服務建構,以發現提示級工具遺漏的故障模式。
Casco
為開發者提供AI應用與代理人威脅偵測、驗證與緩解的安全平台。
Maxim AI
端到端 AI 評測與可觀測平台,加速可靠 AI 智能代理開發與部署。
Penligent
一個自主滲透測試平台,在統一的安全生態系統中結合漏洞偵測、漏洞利用自動化和智慧紅隊功能。

