Noveum.ai
Plateforme d'évaluation en boucle fermée qui trace, évalue et livre des correctifs validés pour les agents IA de chat, vocaux et de workflow en production.
Communauté:
Aperçu du produit
Qu'est-ce que Noveum.ai ?
Noveum.ai est une plateforme d'évaluation et de remédiation d'agents conçue pour les équipes d'ingénierie qui exploitent des agents IA en production. Au lieu de s'arrêter au signalement des échecs, elle capture chaque appel LLM, appel d'outil et étape d'agent via un SDK open source, évalue les exécutions avec plus de 100 scorers calibrés et utilise son moteur NovaPilot pour générer des correctifs candidats. Chaque correctif est testé par backtesting sur les appels en échec, puis re-simulé de bout en bout avant que Noveum ne l'ouvre sous forme de pull request, qu'un humain relit et fusionne. La plateforme prend en charge les agents de chat, vocaux et de workflows multi-étapes, avec des intégrations poussées pour des frameworks comme LangChain, LangGraph, LiveKit, Pipecat et CrewAI, et propose un déploiement on-premise ou avec votre propre ClickHouse pour les entreprises soumises à des exigences strictes de résidence des données.
Fonctionnalités clés
Observabilité NovaTrace
Le SDK open source capture chaque appel LLM, appel d'outil, récupération et étape d'agent, avec les données de tokens, de coût et de latence sur chaque span, en conformité avec OpenTelemetry.
Plus de 100 scorers calibrés
Les traces de production sont automatiquement échantillonnées et évaluées par une vaste bibliothèque de scorers préréglés, sans avoir à constituer manuellement des jeux de données.
Corrections automatisées avec NovaPilot
Remonte des échecs jusqu'à leur cause racine, génère un correctif candidat et le valide par backtesting et re-simulation complète avant d'ouvrir une pull request.
Compatibilité multi-frameworks d'agents
Des intégrations natives pour LangChain, LangGraph, LiveKit, Pipecat et CrewAI couvrent les architectures d'agents de chat, vocaux et de workflows multi-étapes.
Contrôles de déploiement pour l'entreprise
Déploiement on-premise, en VPC ou avec votre propre ClickHouse, avec SSO/SAML, RBAC et journaux d'audit, la certification SOC 2 Type II étant en cours et la conformité RGPD assurée.
Traçage à haut débit
Testé en charge jusqu'à 15 000 spans par seconde, avec plus de 60 millions de spans traités par jour en production.
Cas d'utilisation
- Débogage d'agents vocaux : Les équipes testent les agents vocaux sur de vrais appels, évaluent les conversations avec des scorers vocaux dédiés et valident les correctifs par une simulation de niveau production avant la mise en ligne.
- Assurance qualité des agents de chat : Les traces de chat en production sont converties en évaluations prêtes à l'emploi, ce qui évite de créer à la main des jeux de test ou de choisir manuellement les scorers.
- Supervision des agents de workflow : Les agents multi-étapes sont évalués sur leurs appels d'outils, leurs décisions de routage et leurs résultats de bout en bout, afin de détecter les défaillances qui surviennent entre les étapes.
- Déploiement dans les secteurs réglementés : Les équipes des services financiers, des télécoms et de l'immobilier exécutent Noveum en on-premise ou avec leur propre instance ClickHouse pour garder les données de traces au sein de leur infrastructure.
- Abandon du débogage manuel : Les équipes remplacent la lecture manuelle des logs et le copier-coller des traces dans d'autres outils d'IA par une analyse des spans, des traces et des correctifs suggérés directement dans une seule plateforme.
FAQ
Alternatives à Noveum.ai
Coval
Plateforme d'automatisation de simulation et d'évaluation accélérant le développement fiable d'Agents IA vocaux et conversationnels.
Relari AI
Une plateforme axée sur les contrats pour simuler, tester et valider des applications d'IA générative complexes avec des données synthétiques et une évaluation modulaire.
Bytebot
Agent d'automatisation de bureau open-source qui exécute des flux de travail complexes multi-étapes via des commandes en langage naturel dans un environnement Linux conteneurisé.
Plurai
Une plateforme de confiance ancrée dans le réel pour les agents IA, combinant simulation, évaluation et garde-fous afin d'amener les agents du prototype à une production fiable.
Polarity
Infrastructure d'évaluation en bac à sable pour agents IA, construite autour de vrais services de support pour révéler les modes de défaillance que les outils au niveau des prompts manquent.
Casco
Plateforme de sécurité pour les développeurs afin de détecter, valider et atténuer les menaces dans les applications et agents IA.
Maxim AI
Plateforme complète d'évaluation et d'observabilité de l'IA accélérant le développement et le déploiement fiables d'agents intelligents.
Penligent
Une plateforme de tests de pénétration autonome combinant la détection de vulnérabilités, l'automatisation d'exploits et le red team intelligent dans un écosystème de sécurité unifié.

