icon of Polarity

Polarity

為 AI Agent 打造的沙箱評估基礎設施,基於真實後端服務建構,以發現提示級工具遺漏的故障模式。

社群:

Polarity preview

產品概覽

Polarity 是什麼?

Polarity 是專為生產環境中執行的 AI Agent 設計的評估基礎設施平台。其核心引擎 Keystone 在隔離的 Docker 沙箱中啟動每個 Agent 任務,預載了真實的後端服務——Postgres、Redis、S3 和內部 API——而非模擬相依項。這種真實服務方法使 Polarity 能夠準確檢測有狀態的多步驟故障模式,這些模式通常被 Braintrust、LangSmith 或 Langfuse 等輕量級提示級評估工具所忽略。每個檢測到的故障都附帶一個種子重現器,只需一條命令即可在本地重建完全相同的沙箱,大幅縮短偵錯週期。


主要功能

  • 真實服務沙箱隔離

    每個 Agent 任務都在專用的 Docker 沙箱中執行,預載了即時的 Postgres、Redis、S3 和內部 API 實例,確保評估反映實際生產環境條件,而非模擬環境。

  • 行為不變量評分

    Keystone 根據可配置的行為不變量和禁止操作規則對每次 Agent 執行進行評分,為團隊提供結構化訊號,判斷 Agent 是否在預期邊界內運作。

  • 非確定性測量

    自動複製執行以量化 Agent 在相同輸入下的輸出變化程度,在問題出現在生產環境之前暴露可靠性問題。

  • 一鍵故障重現

    每次失敗的執行都附帶一個種子重現器,可以在本地重建完全相同的沙箱環境,讓開發者無需手動重建環境即可偵錯複雜的 Agent 故障。

  • 自動化程式碼審查與測試

    內建透過 @paragon-review 進行拉取請求審查和端對端測試基礎設施,在程式碼到達生產環境之前捕獲回歸和錯誤。

  • 即時監控與 CLI 助手

    應用程式監控配備即時告警,輔以基於終端的助手(Paragon CLI),可直接從命令列編寫、審查和管理程式碼。


使用案例

  • 生產環境 Agent 評估 : 在生產環境中執行 AI Agent 的工程團隊使用 Polarity 持續評估 Agent 在真實有狀態服務中的行為,捕獲僅在真實條件下出現的故障模式。
  • 複雜多步驟 Agent 測試 : 建構長時間執行、多步驟 Agent 工作流程的團隊依賴 Polarity 驗證整個執行鏈中的正確排序、狀態持久化和服務互動。
  • Agent 可靠性基準測試 : 組織可以測量和比較不同 Agent 版本或配置之間的非確定性,幫助在更廣泛推出之前優先改進穩定性。
  • 快速故障偵錯 : 開發者使用種子重現器即時在本地重建確切的故障條件,縮短難以重現的有狀態錯誤的調查時間。
  • CI/CD 流水線整合 : 開發團隊將 Polarity 的程式碼審查和測試工具嵌入到拉取請求工作流程中,在每次程式碼變更時自動執行品質門控。

常見問題

Polarity 網站分析