Noveum.ai
프로덕션 채팅, 음성, 워크플로 AI 에이전트를 추적하고 채점하며 검증된 수정까지 전달하는 폐루프 평가 플랫폼입니다.
커뮤니티:
제품 개요
Noveum.ai이란 무엇인가요?
Noveum.ai는 프로덕션에서 AI 에이전트를 운영하는 엔지니어링 팀을 위한 에이전트 평가 및 개선 플랫폼입니다. 실패를 표시하는 데 그치지 않고, 오픈소스 SDK로 모든 LLM 호출, 툴 호출, 에이전트 단계를 수집하고, 100개 이상의 보정된 스코어러로 실행 결과를 채점하며, NovaPilot 엔진으로 수정 후보를 생성합니다. 각 수정은 실패한 호출에 대해 백테스트를 거치고 엔드투엔드로 재시뮬레이션된 후, Noveum이 pull request로 열어 사람이 검토하고 병합합니다. 채팅, 음성, 다단계 워크플로 에이전트를 지원하며 LangChain, LangGraph, LiveKit, Pipecat, CrewAI 등 프레임워크와 깊이 통합되고, 엄격한 데이터 상주 요건이 있는 기업을 위해 온프레미스 또는 자체 ClickHouse 배포를 제공합니다.
주요 기능
NovaTrace 옵저버빌리티
오픈소스 SDK가 모든 LLM 호출, 툴 호출, 검색, 에이전트 단계를 수집하고, 각 span에 토큰·비용·지연 시간 데이터를 기록하며 OpenTelemetry와 호환됩니다.
100개 이상의 보정된 스코어러
프로덕션 trace를 자동으로 샘플링하여, 수작업으로 데이터셋을 구성할 필요 없이 사전 튜닝된 대규모 스코어러 라이브러리로 평가합니다.
NovaPilot 자동 수정
실패의 근본 원인을 추적하고 수정 후보를 생성한 뒤, 백테스트와 전체 재시뮬레이션으로 검증한 다음 pull request를 엽니다.
멀티 에이전트 프레임워크 지원
LangChain, LangGraph, LiveKit, Pipecat, CrewAI를 기본 통합하여 채팅, 음성, 다단계 워크플로 에이전트 아키텍처를 모두 지원합니다.
엔터프라이즈 배포 제어
온프레미스, VPC 또는 자체 ClickHouse 배포를 지원하며 SSO/SAML, RBAC, 감사 로그를 제공합니다. SOC 2 Type II 인증을 진행 중이며 GDPR을 준수합니다.
고처리량 트레이싱
초당 15,000개 span까지 부하 테스트를 마쳤으며, 프로덕션 환경에서 하루 6,000만 개 이상의 span을 처리하고 있습니다.
사용 사례
- 음성 에이전트 디버깅 : 실제 통화에서 음성 에이전트를 테스트하고, 전용 음성 스코어러로 대화를 채점하며, 릴리스 전에 프로덕션 수준의 시뮬레이션으로 수정 사항을 검증합니다.
- 채팅 에이전트 품질 보증 : 프로덕션 채팅 trace를 바로 실행 가능한 평가로 변환하여, 테스트 데이터셋을 직접 만들거나 스코어러를 수동으로 고를 필요가 없습니다.
- 워크플로 에이전트 모니터링 : 다단계 에이전트의 툴 호출, 라우팅 결정, 엔드투엔드 결과를 평가하여 단계 사이에서 발생하는 실패를 잡아냅니다.
- 규제 산업 배포 : 금융, 통신, 부동산 팀은 Noveum을 온프레미스 또는 자체 ClickHouse 인스턴스로 운영하여 trace 데이터를 자사 인프라 안에 보관합니다.
- 수동 디버깅에서의 전환 : 로그를 수동으로 검토하거나 trace를 다른 AI 도구에 복사·붙여넣기 하던 방식에서 벗어나, 하나의 플랫폼 안에서 span, trace, 수정 제안을 바로 분석합니다.
자주 묻는 질문
Noveum.ai 대안
Coval
AI 음성 및 채팅 에이전트 개발을 가속화하는 자동 시뮬레이션 및 평가 플랫폼
Relari AI
합성 데이터와 모듈형 평가를 통해 복잡한 생성형 AI 애플리케이션을 시뮬레이션, 테스트, 검증하는 계약 중심 플랫폼입니다.
Bytebot
컨테이너화된 Linux 환경에서 자연어 명령을 통해 복잡한 다단계 워크플로우를 실행하는 오픈소스 데스크톱 자동화 Agent입니다.
Plurai
AI 에이전트를 위한 실세계 신뢰 플랫폼으로, 시뮬레이션·평가·가드레일을 결합해 에이전트를 프로토타입에서 신뢰할 수 있는 프로덕션으로 끌어올립니다.
Polarity
AI Agent를 위한 샌드박스 평가 인프라로, 프롬프트 수준 도구가 놓치는 장애 모드를 발견하기 위해 실제 백엔드 서비스를 기반으로 구축되었습니다.
Casco
AI 애플리케이션과 에이전트의 위협을 탐지, 검증, 완화하는 개발자용 보안 플랫폼.
Maxim AI
신뢰할 수 있는 AI 에이전트 개발 및 배포를 가속화하는 엔드 투 엔드 AI 평가 및 가시성 플랫폼
Penligent
통합된 보안 생태계에서 취약점 탐지, 익스플로잇 자동화 및 지능형 레드팀 기능을 결합한 자율 침투 테스트 플랫폼입니다.

