icon of Oqoqo

Oqoqo

用于构建评测和私有基准的平台,衡量 AI Agent 能否通过 MCP、CLI、SDK 和 API 成功使用真实产品。

社区:

产品概览

什么是Oqoqo?

Oqoqo preview

Oqoqo 是一个评测平台,为 AI Agent(而不只是人类)正逐渐成为软件主要使用者的时代而生。团队不再依赖脱离真实工作流的通用公开基准,而是用日常语言定义自己的任务集和成功标准,再让 Claude Code、Codex、Cursor 等 Agent 在产品界面的不同版本上尝试完成这些任务。每次试验都运行在隔离的一次性沙箱中,配备 Agent 在生产环境会遇到的完整文件、凭证和工具,Agent 的每一步操作都被完整记录为执行轨迹。最终得到的是一个私有基准,报告通过率、相对基线的提升幅度、token 与成本数据,以及导致失败的具体摩擦点,方便针对性修复产品与文档问题,并随时重新测试。


主要功能

  • 私有任务集与评分标准

    团队用日常语言编写真实任务和通过/失败标准,完全掌握可版本化的基准测试,确保未来多次运行结果始终可比。

  • 多 Agent、多模型测试

    在 Claude Code、Codex、Cursor、GitHub Copilot、OpenCode、OpenClaw、Pi 和 Hermes 上运行相同任务,可按 Agent 选择模型和算力等级,比较谁的表现更好。

  • 隔离沙箱执行

    每次试验都在全新的一次性云端环境中启动,贴近真实 Agent 运行条件,避免运行之间泄露提示,保证结果可复现。

  • 完整执行轨迹记录

    记录每一次工具调用、命令、文件改动和 token 用量,让评估者能对每条要求逐一打分,并写明理由和引用出处。

  • 摩擦与失败诊断

    反复出现的障碍——自相矛盾的文档、失效的安装步骤、误导性报错——会按严重程度和责任方归类,精准定位产品或界面需要修复的地方。

  • CI/CD 就绪的回归测试

    可通过 CLI 或 MCP 由代码变更直接触发实验,在 API、SDK 或文档更新上线前,提前发现 Agent 体验回归。


使用场景

  • Agent 就绪度测试 : 开发者工具团队验证编码 Agent 能否在真实任务中实际发现并使用自家的 MCP 服务器、CLI 或 SDK,而不只是精心准备的演示。
  • 模型与 Harness 选型 : 产品团队在特定领域的工作流上比较不同 Agent 和模型的通过率,决定官方支持哪些组合。
  • 文档调试 : 技术文档和 DevRel 团队借助摩擦报告,找出文档与实际 API 行为矛盾之处,修正 Agent 卡住的具体步骤。
  • 发布回归防护 : 工程团队把实验接入 CI,在新版 API 或 SDK 破坏 Agent 工作流之前就将其拦截,不让问题流入生产环境。
  • 面向 Agent 的界面重设计 : 产品团队对比原生 Agent 访问与 MCP、CLI 方案的效果,量化更优界面设计能为 Agent 成功率带来多少提升。

常见问题

Oqoqo网站分析