本轮判断
当前小样本可以完成 Anthropic Messages、OpenAI Responses、Claude Code 和 Codex CLI 任务;但 Codex 需要关闭一个不受支持的默认工具,且单一时段不能证明长期稳定。
本站一手测试 · 2026-08-02
围绕两种协议直调和两款开发工具代码任务,记录本轮可核对的结果、账单摘要和兼容边界。
首轮结果
以下指标只代表本轮单一时段的小样本,不外推长期稳定性。
本轮判断
当前小样本可以完成 Anthropic Messages、OpenAI Responses、Claude Code 和 Codex CLI 任务;但 Codex 需要关闭一个不受支持的默认工具,且单一时段不能证明长期稳定。
协议直调
固定提示词,单次输出上限 128 Token;时延为客户端端到端记录。
| 协议与模型 | 成功 | 最小时延 | 中位时延 | 最大时延 | Token(输入 / 输出) |
|---|---|---|---|---|---|
| OpenAI Responses gpt-5.6-luna | 5 / 5 | 1.485s | 1.733s | 3.011s | 1,600 / 178 |
| Anthropic Messages claude-haiku-4-5 | 5 / 5 | 1.123s | 1.522s | 3.747s | 160 / 95 |
Responses 的 5 次结果均通过严格 JSON 形态校验;Anthropic 的 5 次结果均返回 Markdown 代码围栏包裹的 JSON。“HTTP 成功”不等于严格结构化输出合规,调用方仍需做解析与校验。
开发工具
任务内容为读取文件、修复加法实现并运行单元测试;测试文件未被修改。
| 测试部分 | 请求数 | 消耗 |
|---|---|---|
| 两种协议直接请求 | 10 | $0.00093488 |
| Claude Code 微任务 | 5 | $0.01194080 |
| Codex CLI 成功任务 | 3 | $0.01456115 |
| 合计 | 18 | $0.02743683 |
金额按本轮站方日志逐笔汇总;不同路由、模型、等级或活动可能改变价格。
测试结论仅适用于本页公开的样本与限制,不能外推长期稳定性。
Poixe 详情页同时保留当前价格、运营主体、风险、第三方材料和本轮一手测试证据。