icon of Oqoqo

Oqoqo

用於建立評測與私有基準的平台,衡量 AI Agent 能否透過 MCP、CLI、SDK 與 API 成功使用真實產品。

社群:

產品概覽

Oqoqo 是什麼?

Oqoqo preview

Oqoqo 是一個評測平台,為 AI Agent(而不只是人類)正逐漸成為軟體主要使用者的時代而生。團隊不再依賴脫離真實工作流程的通用公開基準,而是用日常語言定義自己的任務集與成功標準,再讓 Claude Code、Codex、Cursor 等 Agent 在產品介面的不同版本上嘗試完成這些任務。每次試驗都在隔離的一次性沙箱中執行,配備 Agent 在正式環境會遇到的完整檔案、憑證與工具,Agent 的每一個步驟都會被完整記錄成執行軌跡。最終得到的是一個私有基準,能回報通過率、相對基準線的提升幅度、token 與成本數據,以及導致失敗的具體摩擦點,方便針對性地修正產品與文件問題,並隨時重新測試。


主要功能

  • 私有任務集與評分標準

    團隊用日常語言撰寫真實任務與通過/失敗標準,完全掌握可版本控管的基準測試,確保未來多次執行的結果都能互相比較。

  • 多 Agent、多模型測試

    在 Claude Code、Codex、Cursor、GitHub Copilot、OpenCode、OpenClaw、Pi 與 Hermes 上執行相同任務,並可依 Agent 選擇模型與運算強度,比較誰的表現最好。

  • 隔離沙箱執行

    每次試驗都在全新、一次性的雲端環境中啟動,貼近真實 Agent 運作條件,避免不同執行之間洩漏提示,確保結果可重現。

  • 完整執行軌跡記錄

    記錄每一次工具呼叫、指令、檔案變更與 token 用量,讓評估者能針對每項要求逐一評分,並附上文字理由與引用出處。

  • 摩擦與失敗診斷

    反覆出現的障礙——互相矛盾的文件、失效的安裝步驟、誤導性錯誤訊息——會依嚴重程度與負責對象分類,精準指出產品或介面需要修正之處。

  • CI/CD 就緒的回歸測試

    可透過 CLI 或 MCP 由程式碼變更直接觸發實驗,在 API、SDK 或文件更新上線前,提前抓出 Agent 體驗的回歸問題。


使用案例

  • Agent 就緒度測試 : 開發者工具團隊驗證編碼 Agent 是否真的能在實際任務中找到並使用自家的 MCP 伺服器、CLI 或 SDK,而不只是精心準備的展示情境。
  • 模型與 Harness 選型 : 產品團隊在特定領域的工作流程上比較不同 Agent 與模型的通過率,藉此決定官方要支援哪些組合。
  • 文件除錯 : 技術文件與 DevRel 團隊透過摩擦報告,找出文件與實際 API 行為互相矛盾之處,修正 Agent 卡住的具體步驟。
  • 發布回歸防護 : 工程團隊將實驗接入 CI,在新版 API 或 SDK 破壞 Agent 工作流程之前就攔截下來,避免問題流入正式環境。
  • 面向 Agent 的介面重新設計 : 產品團隊比較原生 Agent 存取方式與 MCP、CLI 方案的差異,量化更好的介面設計能為 Agent 成功率帶來多少提升。

常見問題

Oqoqo 的替代方案

🚀

Oqoqo 網站分析