# 任务网址直开：同版本开关对照与 Browser Use 配对任务

日期：2026-09-24。Tablaze 使用干净提交 [`aa6da8c`](https://github.com/SweetDianDian/tablaze/commit/aa6da8c74fffe462175e6859ffa5cfa82561ef0b)（工作树补丁 SHA-256 `e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855`），Browser Use Python Agent 0.13.10 固定在 [`d8110c5`](https://github.com/browser-use/browser-use/tree/d8110c5ff87ccba887aaa726cdb780f2f84bef8d)。双方使用已登录的 Codex CLI `0.155.0-alpha.9.2`、`gpt-6-astra / ultra`、相同的 50,000 已报告 token 上限、40 步和 240 秒截止时间。每次任务使用独立的本地网页、重置的服务端状态与 Chrome 浏览器；Browser Use 保留默认任务后模型评审。运行器在模型调用、浏览器工具、服务端写入和清理阶段保留原始记录。

本次共测两个可见合成任务，每项用种子 100–102：表单保存 `Ada / Lisbon`，以及在子 iframe 保存 `Vega`。服务端验收要求准确的一次写入，重复写入视为失败。先运行 Tablaze 直开与 Browser Use 的配对批次，再在**同一 Tablaze 提交**上运行直开关闭的对照批次。第二批没有与第一批交错，模型决策也不完全确定，因此开关前后的耗时差是描述性样本，不能单独证明因果收益。

下表每格依次是 **全程秒数 / Agent 报告完成秒数 / 模型调用次数**。Browser Use 的全程时间与模型调用次数包含默认任务后评审；Agent 完成时间不含该评审。全程计时与 Agent 完成计时的起点也不同。

| 任务 | 种子 | Tablaze 直开 | Tablaze 关闭 | Browser Use |
| --- | ---: | ---: | ---: | ---: |
| 表单 | 100 | 35.726 / 35.587 / 2 | 46.658 / 46.511 / 3 | 50.134 / 35.108 / 3 |
| 表单 | 101 | 30.530 / 30.378 / 2 | 55.731 / 55.583 / 3 | 56.442 / 40.440 / 3 |
| 表单 | 102 | 28.131 / 27.983 / 2 | 58.412 / 58.279 / 3 | 51.532 / 37.647 / 3 |
| iframe | 100 | 61.450 / 61.308 / 3 | 77.516 / 77.377 / 4 | 62.533 / 38.358 / 3 |
| iframe | 101 | 55.483 / 55.328 / 3 | 51.834 / 51.685 / 3 | 57.698 / 40.495 / 3 |
| iframe | 102 | 56.467 / 56.317 / 3 | 69.146 / 69.006 / 4 | 65.410 / 43.872 / 3 |

**服务端结果：**直开 Tablaze 6/6、关闭 Tablaze 6/6、Browser Use 6/6 均通过业务验收与各自 Agent 完成、截止时间检查；每次恰好一次正确写入，零重复。直开 Tablaze 的六条轨迹都在第 0 步打开任务中的唯一网址，让首次模型调用直接收到页面快照；关闭时首次打开由模型决定。

表单的三个种子中，Tablaze 直开均使用 **2 次**规划调用，关闭均为 **3 次**。中位 Agent 完成时间分别为 **30.378 秒**和 **55.583 秒**，Browser Use 为 **37.647 秒**；中位全程分别为 **30.530、55.731、51.532 秒**。Browser Use 的 3 次模型调用中含一次默认评审，因此不能直接解释为比直开 Tablaze 多一次任务规划。

iframe 的中位 Agent 完成时间为 **56.317 秒**（Tablaze 直开）、**69.006 秒**（关闭）、**40.495 秒**（Browser Use）；中位全程为 **56.467、69.146、62.533 秒**。直开 Tablaze 在这个任务的 Agent 阶段仍明显慢于 Browser Use。三个直开轨迹均在提交后请求检查页面正文是否包含输入值 `Vega`，尽管字段的 `value` 检查已通过、页面状态已显示保存成功。正文检查不包含输入框原始值，故每次等待约 5 秒后失败，再增加一次模型规划和单独验证。不能用包含 Browser Use 评审的全程时间掩盖这个缺口；下一阶段应针对该决策与验收交互做可验证改进。

这些是可见的本地合成任务，每项仅三个种子；开关对照没有交错排序，Codex CLI 的逐次温度和输出 token 控制未独立验证。它们不估计 p95、生产网站成功率或整体功能优势，也不涵盖 Browser Use 的 MCP、Harness、Pi 和云服务。功能可用与初步耗时已验证，全面对等或超过 Browser Use **尚未证明**。

未改写的 [配对运行器结果](evidence/direct-task-url-20260924/results-on-matched.json) SHA-256 为 `aabca4f4c6f32297aecaa3346926d8ec1561a14327c1f08dad1fa76f783fe2aa`；[Tablaze 关闭对照结果](evidence/direct-task-url-20260924/results-off-tablaze.json) SHA-256 为 `774edec092ed963747ddc6988abd17b71a94bd18d6235f0531a205b60870db9b`。[轨迹索引](evidence/direct-task-url-20260924/README.md)链接全部 18 条原始轨迹。
