实测报告 · 2026-08-08 → 2026-09-07
一台机器,30 天,
1,660 个会话。
这不是跑分,是一台开发机上 30.4 天的完整用量记录。每一条数字都从本地 transcript 重算——没有估算,没有挑样本。Fleet 卖的不是更快的模型,是把同一份人类注意力摊到更多条并行的活上;这页把它摊到了什么程度量出来。
81.6×
每一次人类介入,换来 81.6 次模型往返。382,874 次 API 调用,只对应 4,693 次人类输入。
同时在跑的会话(时间加权均值)
6.98
峰值 26。裸命令行的上限是 1——一个终端一个会话。
至少两条会话并行的时间占比
99.4%
30 天里几乎没有「只有一条活在跑」的时刻。
跨上下文窗口的接力续跑
524
窗口写满不等于任务结束:后继会话带着交接便条接着干。
等价 API 用量(list price 重算)
$108,981
按官方单价对每条 usage 记录重算,非实付账单——账号在订阅制上。
并行度,是唯一能买到的吞吐。
一个人能推进多少条工程线,取决于他能同时看住几条。下面两张图是 30.4 天里的实际分布与逐日曲线——不是峰值截图。
忙时里同时活跃的会话数
占 729.8 小时活跃挂钟的比例;只统计人类真的输入过、且长于 60 秒的会话
表格视图
| 并行会话数 | 占活跃挂钟 | 累计小时 |
|---|---|---|
| 2+ | 99.4% | 725.4 h |
| 3+ | 85.3% | 622.5 h |
| 5+ | 71.8% | 523.9 h |
| 10+ | 25.0% | 182.4 h |
| peak | 26 | — |
逐日的模型往返次数
Fleet 拉起的会话,按调用自身的时间戳归日;31 天共 380,284 次
表格视图
| 日期 | API 调用 | 活跃会话 |
|---|---|---|
| 2026-08-08 | 2,042 | 10 |
| 2026-08-09 | 560 | 5 |
| 2026-08-10 | 39 | 2 |
| 2026-08-11 | 35 | 2 |
| 2026-08-12 | 32 | 2 |
| 2026-08-13 | 1,796 | 10 |
| 2026-08-14 | 3,155 | 17 |
| 2026-08-15 | 8,205 | 32 |
| 2026-08-16 | 4,337 | 23 |
| 2026-08-17 | 6,093 | 22 |
| 2026-08-18 | 14,710 | 42 |
| 2026-08-19 | 10,560 | 43 |
| 2026-08-20 | 16,563 | 51 |
| 2026-08-21 | 20,434 | 69 |
| 2026-08-22 | 15,451 | 62 |
| 2026-08-23 | 23,074 | 80 |
| 2026-08-24 | 21,135 | 77 |
| 2026-08-25 | 21,287 | 87 |
| 2026-08-26 | 16,311 | 79 |
| 2026-08-27 | 16,079 | 64 |
| 2026-08-28 | 12,847 | 37 |
| 2026-08-29 | 11,852 | 31 |
| 2026-08-30 | 16,013 | 34 |
| 2026-08-31 | 17,363 | 33 |
| 2026-09-01 | 16,870 | 31 |
| 2026-09-02 | 26,901 | 58 |
| 2026-09-03 | 12,716 | 32 |
| 2026-09-04 | 15,612 | 32 |
| 2026-09-05 | 13,305 | 36 |
| 2026-09-06 | 20,560 | 87 |
| 2026-09-07 | 14,347 | 77 |
一次人类介入换来的机器工作量
每一个方块是一次调用;橙色的那一个是人类那次输入
表格视图
| 计数 | 30.4 天总量 | 相对人类输入 |
|---|---|---|
| 382,874 次 API 调用 | 382,874 | 81.6× |
| 4,693 次人类输入 | 4,693 | 1× |
| 4,215 张决策卡 | 4,215 | 0.90× |
这些吞吐买到了什么。
每一项都配一个本机实测数字,以及裸命令行在同一位置的行为。没有实测数字的能力不在这张表上。
6.98
并行工程线
时间加权的同时活跃会话数,峰值 26。每条有自己的 worktree、自己的计划、自己的验证。
裸命令行:1 条,且切走就停。
524
上下文窗口不再是终点
窗口将满时登记一次交接,Fleet 拉起后继会话,把便条与计划一起递过去。30 天内发生 524 次。
裸命令行:压缩后自己找线索,或人工重开。
45
无人值守的活
定时与循环触发的会话,键盘前没有人。廉价探测先跑,条件不满足就不起 LLM。
裸命令行:0,终端关掉就没了。
4,215
决策收敛成卡
需要判断的时刻变成一张带选项的卡,中位 147 秒得到回答;手机上也能回。
裸命令行:混在输出里,靠人自己发现。
382,874
每次调用都在账上
全部调用带 usage 落盘,可按会话、模型、时段重算成本——这页的数字就是这么来的。
裸命令行:同样有 transcript,但没有聚合视图。
97.9%
长上下文靠缓存兜住
输入里 97.9% 命中提示缓存,这是让 19 万 token 的单次调用在经济上可行的前提。
能力来源:Claude Code,非 Fleet 引入。
口径与方法。
本节列出每个数字的采集与计算口径,以及本页数据的适用范围。
怎么测的
- 用量与成本:遍历
~/.claude/projects/*/*.jsonl的每一条 usage 记录,按当前官方单价重算,缓存写入按 5 分钟 / 1 小时 TTL 分别计价。不采信任何现成账本。 - 并发度:会话首末时间戳当区间做扫描线,按挂钟加权;排除 Claude Code 自身的秒级辅助运行。
- 逐日曲线:每次 API 调用按它自己的时间戳归入本地日期,不按会话开始时间归属。
- 等待时间:决策卡的
tool_use与配对tool_result的时间戳差。 - 会话来源:每份 transcript 首条 user 记录的
entrypoint字段,Fleet 拉起的会话带自己的标记。
适用范围说明
测量类型。本页为观察性用量记录,非同任务对照实验。并行度、接力与无人值守三项的裸命令行数值取自其结构性上限(一个终端一个会话、窗口写满即止、终端关闭即停),非实测样本。
样本规模。单一使用者、单台机器、30.4 天,n = 1。适用于描述该配置下的真实用量,不宜直接外推为跨环境的一般结论;多样本对照研究另行开展。
费用口径。$108,981 为按 API 官方单价对本地 usage 记录重算的等价用量,非账单金额;该账号采用订阅制计费,实付金额与此不同。
数据窗口:30.4 天为本机 transcript 的保留期,非累计使用史。开销项:Fleet 的纪律注入与记账往返使单次调用的输入约增 23%、输出约增 9%,机器侧挂钟约增 4–6%,与上述吞吐一并列出。
常见问题
Fleet 会不会更费 token?
会。它往每次调用里注入纪律与计划上下文,也多产生记账、交接、出卡的往返:输入约 +23%、输出约 +9%、调用次数 +7%。换来的是本页量出的并行度与无人值守能力;token 用量本身不是该设计的优化目标。
这些数字能在我自己的机器上复算吗?
能。全部来自 ~/.claude/projects 下的本地 transcript,采集与核算脚本随本页发布,读的是你自己的 usage 记录。
机器会不会因为 hook 变慢?
实测可以忽略:每轮的计划注入约 10 毫秒,计划记账中位 0.0 秒,交接与 worktree 操作中位 1.4 秒。真正的等待来自决策卡等人回答——那是人的响应时间。
为什么没有同任务 A/B 对照?
本机的裸终端会话仅 2 个,不足以构成对照组;事后补造的对照不纳入本页。完整的同任务 A/B 需要固定任务集、两种模式各跑一遍,并控制模型版本与操作者的学习效应,该项工作另行开展。本页可支撑的是差分测量:把 Fleet 注入的文本从同一次调用中减去,误差来源为分词而非任务差异。并行度、接力与无人值守三项对照的是裸命令行的结构性上限,已在口径区标注为非实测样本。