Claw Fleet

实测报告 · 2026-08-08 → 2026-09-07

一台机器,30 天,
1,660 个会话。

这不是跑分,是一台开发机上 30.4 天的完整用量记录。每一条数字都从本地 transcript 重算——没有估算,没有挑样本。Fleet 卖的不是更快的模型,是把同一份人类注意力摊到更多条并行的活上;这页把它摊到了什么程度量出来。

81.6×

每一次人类介入,换来 81.6 次模型往返。382,874 次 API 调用,只对应 4,693 次人类输入。

同时在跑的会话(时间加权均值)

6.98

峰值 26。裸命令行的上限是 1——一个终端一个会话。

至少两条会话并行的时间占比

99.4%

30 天里几乎没有「只有一条活在跑」的时刻。

跨上下文窗口的接力续跑

524

窗口写满不等于任务结束:后继会话带着交接便条接着干。

等价 API 用量(list price 重算)

$108,981

按官方单价对每条 usage 记录重算,非实付账单——账号在订阅制上。


并行度,是唯一能买到的吞吐。

一个人能推进多少条工程线,取决于他能同时看住几条。下面两张图是 30.4 天里的实际分布与逐日曲线——不是峰值截图。

忙时里同时活跃的会话数

占 729.8 小时活跃挂钟的比例;只统计人类真的输入过、且长于 60 秒的会话

≥ 2 条并行

99.4%

≥ 3 条并行

85.3%

≥ 5 条并行

71.8%

≥ 10 条并行

25.0%

025%50%75%100%
裸命令行在这张图上没有条形,因为它的上限是结构性的而非分布:一个终端一个会话,切走就停——所以它 100% 的时间都是 1 条。口径:把每个会话的首末时间戳当作一个区间做扫描线,按挂钟时长加权。已排除 Claude Code 自身的秒级辅助运行(生成标题、摘要);若一并计入,峰值读数为 199。
表格视图
并行会话数占活跃挂钟累计小时
2+99.4%725.4 h
3+85.3%622.5 h
5+71.8%523.9 h
10+25.0%182.4 h
peak26—

逐日的模型往返次数

Fleet 拉起的会话,按调用自身的时间戳归日;31 天共 380,284 次

0k10k20k30k 26,901 08-0808-1508-2208-2909-052026-08-08 · 2,042 次调用 · 10 个会话2026-08-09 · 560 次调用 · 5 个会话2026-08-10 · 39 次调用 · 2 个会话2026-08-11 · 35 次调用 · 2 个会话2026-08-12 · 32 次调用 · 2 个会话2026-08-13 · 1,796 次调用 · 10 个会话2026-08-14 · 3,155 次调用 · 17 个会话2026-08-15 · 8,205 次调用 · 32 个会话2026-08-16 · 4,337 次调用 · 23 个会话2026-08-17 · 6,093 次调用 · 22 个会话2026-08-18 · 14,710 次调用 · 42 个会话2026-08-19 · 10,560 次调用 · 43 个会话2026-08-20 · 16,563 次调用 · 51 个会话2026-08-21 · 20,434 次调用 · 69 个会话2026-08-22 · 15,451 次调用 · 62 个会话2026-08-23 · 23,074 次调用 · 80 个会话2026-08-24 · 21,135 次调用 · 77 个会话2026-08-25 · 21,287 次调用 · 87 个会话2026-08-26 · 16,311 次调用 · 79 个会话2026-08-27 · 16,079 次调用 · 64 个会话2026-08-28 · 12,847 次调用 · 37 个会话2026-08-29 · 11,852 次调用 · 31 个会话2026-08-30 · 16,013 次调用 · 34 个会话2026-08-31 · 17,363 次调用 · 33 个会话2026-09-01 · 16,870 次调用 · 31 个会话2026-09-02 · 26,901 次调用 · 58 个会话2026-09-03 · 12,716 次调用 · 32 个会话2026-09-04 · 15,612 次调用 · 32 个会话2026-09-05 · 13,305 次调用 · 36 个会话2026-09-06 · 20,560 次调用 · 87 个会话2026-09-07 · 14,347 次调用 · 77 个会话
8 月中旬那一段低谷是真实的:那几天只有两条长会话在跑。之后的高原不是某一天的冲刺,而是持续三周的日常负载——日均 1.2 万次调用,峰值 2.7 万。
表格视图
日期API 调用活跃会话
2026-08-082,04210
2026-08-095605
2026-08-10392
2026-08-11352
2026-08-12322
2026-08-131,79610
2026-08-143,15517
2026-08-158,20532
2026-08-164,33723
2026-08-176,09322
2026-08-1814,71042
2026-08-1910,56043
2026-08-2016,56351
2026-08-2120,43469
2026-08-2215,45162
2026-08-2323,07480
2026-08-2421,13577
2026-08-2521,28787
2026-08-2616,31179
2026-08-2716,07964
2026-08-2812,84737
2026-08-2911,85231
2026-08-3016,01334
2026-08-3117,36333
2026-09-0116,87031
2026-09-0226,90158
2026-09-0312,71632
2026-09-0415,61232
2026-09-0513,30536
2026-09-0620,56087
2026-09-0714,34777

一次人类介入换来的机器工作量

每一个方块是一次调用;橙色的那一个是人类那次输入

人类输入 1 次模型往返 81.6 次
382,874 次 API 调用4,693 次人类输入4,215 张决策卡
决策卡数量与人类输入次数几乎相等——Fleet 把「需要人」的时刻收敛成一张带选项的卡,而不是散落在满屏输出里等人自己发现。这些卡的中位响应等待是 147 秒。
表格视图
计数30.4 天总量相对人类输入
382,874 次 API 调用382,87481.6×
4,693 次人类输入4,6931×
4,215 张决策卡4,2150.90×

这些吞吐买到了什么。

每一项都配一个本机实测数字,以及裸命令行在同一位置的行为。没有实测数字的能力不在这张表上。

6.98

并行工程线

时间加权的同时活跃会话数,峰值 26。每条有自己的 worktree、自己的计划、自己的验证。

裸命令行:1 条,且切走就停。

524

上下文窗口不再是终点

窗口将满时登记一次交接,Fleet 拉起后继会话,把便条与计划一起递过去。30 天内发生 524 次。

裸命令行:压缩后自己找线索,或人工重开。

45

无人值守的活

定时与循环触发的会话,键盘前没有人。廉价探测先跑,条件不满足就不起 LLM。

裸命令行:0,终端关掉就没了。

4,215

决策收敛成卡

需要判断的时刻变成一张带选项的卡,中位 147 秒得到回答;手机上也能回。

裸命令行:混在输出里,靠人自己发现。

382,874

每次调用都在账上

全部调用带 usage 落盘,可按会话、模型、时段重算成本——这页的数字就是这么来的。

裸命令行:同样有 transcript,但没有聚合视图。

97.9%

长上下文靠缓存兜住

输入里 97.9% 命中提示缓存,这是让 19 万 token 的单次调用在经济上可行的前提。

能力来源:Claude Code,非 Fleet 引入。


口径与方法。

本节列出每个数字的采集与计算口径,以及本页数据的适用范围。

怎么测的

  1. 用量与成本:遍历 ~/.claude/projects/*/*.jsonl 的每一条 usage 记录,按当前官方单价重算,缓存写入按 5 分钟 / 1 小时 TTL 分别计价。不采信任何现成账本。
  2. 并发度:会话首末时间戳当区间做扫描线,按挂钟加权;排除 Claude Code 自身的秒级辅助运行。
  3. 逐日曲线:每次 API 调用按它自己的时间戳归入本地日期,不按会话开始时间归属。
  4. 等待时间:决策卡的 tool_use 与配对 tool_result 的时间戳差。
  5. 会话来源:每份 transcript 首条 user 记录的 entrypoint 字段,Fleet 拉起的会话带自己的标记。

适用范围说明

测量类型。本页为观察性用量记录,非同任务对照实验。并行度、接力与无人值守三项的裸命令行数值取自其结构性上限(一个终端一个会话、窗口写满即止、终端关闭即停),非实测样本。

样本规模。单一使用者、单台机器、30.4 天,n = 1。适用于描述该配置下的真实用量,不宜直接外推为跨环境的一般结论;多样本对照研究另行开展。

费用口径。$108,981 为按 API 官方单价对本地 usage 记录重算的等价用量,非账单金额;该账号采用订阅制计费,实付金额与此不同。

数据窗口:30.4 天为本机 transcript 的保留期,非累计使用史。开销项:Fleet 的纪律注入与记账往返使单次调用的输入约增 23%、输出约增 9%,机器侧挂钟约增 4–6%,与上述吞吐一并列出。


常见问题

Fleet 会不会更费 token?

会。它往每次调用里注入纪律与计划上下文,也多产生记账、交接、出卡的往返:输入约 +23%、输出约 +9%、调用次数 +7%。换来的是本页量出的并行度与无人值守能力;token 用量本身不是该设计的优化目标。

这些数字能在我自己的机器上复算吗?

能。全部来自 ~/.claude/projects 下的本地 transcript,采集与核算脚本随本页发布,读的是你自己的 usage 记录。

机器会不会因为 hook 变慢?

实测可以忽略:每轮的计划注入约 10 毫秒,计划记账中位 0.0 秒,交接与 worktree 操作中位 1.4 秒。真正的等待来自决策卡等人回答——那是人的响应时间。

为什么没有同任务 A/B 对照?

本机的裸终端会话仅 2 个,不足以构成对照组;事后补造的对照不纳入本页。完整的同任务 A/B 需要固定任务集、两种模式各跑一遍,并控制模型版本与操作者的学习效应,该项工作另行开展。本页可支撑的是差分测量:把 Fleet 注入的文本从同一次调用中减去,误差来源为分词而非任务差异。并行度、接力与无人值守三项对照的是裸命令行的结构性上限,已在口径区标注为非实测样本。