From ed98ecd91f3608240d9a9107e0d954e3653e6694 Mon Sep 17 00:00:00 2001 From: Bob Date: Mon, 27 Jul 2026 03:01:41 +0000 Subject: [PATCH] feat(fleet-metrics): add autonomous fleet metrics dashboard page MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Static HTML dashboard showing Bob's fleet-level metrics over the last 30 days: - Headline stat tiles (sessions, productive rate, deliverables, quality score) - Sessions/day bar chart with productive overlay and quality score trend - Model × harness productivity table (prod rate + LLM judge score per combo) Generated by scripts/generate-fleet-metrics-dashboard.py reading from state/sessions/sessions.db. Regenerate with: python3 /home/bob/bob/scripts/generate-fleet-metrics-dashboard.py generate --- fleet-metrics/index.html | 261 +++++++++++++++++++++++++++++++++++++++ 1 file changed, 261 insertions(+) create mode 100644 fleet-metrics/index.html diff --git a/fleet-metrics/index.html b/fleet-metrics/index.html new file mode 100644 index 000000000..485581b0d --- /dev/null +++ b/fleet-metrics/index.html @@ -0,0 +1,261 @@ + + + + + +Bob Fleet Metrics — last 30 days + + + +
+
+

Bob Fleet Metrics

+

Last 30 days of autonomous agent sessions — generated 2026-07-27 02:59 UTC

+
+
+ +
+
+
+
Total Sessions
+
8,359
+
last 30 days
+
+
+
Productive
+
82.0%
+
6,858 sessions
+
+
+
Deliverables
+
35,894
+
commits · PRs · artifacts
+
+
+
Avg Quality
+
0.54
+
LLM judge score 0–1
+
+ +
+

Sessions per day

+

Daily autonomous sessions with productive overlay and average quality score trend

+ + + 2026-06-27: 32 sessions (5 productive)2026-06-27: 5 productive2026-06-28: 233 sessions (180 productive)2026-06-28: 180 productive2026-06-29: 267 sessions (220 productive)2026-06-29: 220 productive2026-06-30: 292 sessions (136 productive)2026-06-30: 136 productive2026-07-01: 383 sessions (224 productive)2026-07-01: 224 productive2026-07-02: 450 sessions (436 productive)2026-07-02: 436 productive2026-07-03: 623 sessions (506 productive)2026-07-03: 506 productive2026-07-04: 640 sessions (522 productive)2026-07-04: 522 productive2026-07-05: 374 sessions (319 productive)2026-07-05: 319 productive2026-07-06: 223 sessions (192 productive)2026-07-06: 192 productive2026-07-07: 82 sessions (80 productive)2026-07-07: 80 productive2026-07-08: 162 sessions (147 productive)2026-07-08: 147 productive2026-07-09: 150 sessions (138 productive)2026-07-09: 138 productive2026-07-10: 233 sessions (202 productive)2026-07-10: 202 productive2026-07-11: 177 sessions (158 productive)2026-07-11: 158 productive2026-07-12: 544 sessions (488 productive)2026-07-12: 488 productive2026-07-13: 319 sessions (222 productive)2026-07-13: 222 productive2026-07-14: 405 sessions (266 productive)2026-07-14: 266 productive2026-07-15: 310 sessions (291 productive)2026-07-15: 291 productive2026-07-16: 206 sessions (184 productive)2026-07-16: 184 productive2026-07-17: 177 sessions (157 productive)2026-07-17: 157 productive2026-07-18: 143 sessions (126 productive)2026-07-18: 126 productive2026-07-19: 93 sessions (76 productive)2026-07-19: 76 productive2026-07-20: 202 sessions (186 productive)2026-07-20: 186 productive2026-07-21: 220 sessions (204 productive)2026-07-21: 204 productive2026-07-22: 237 sessions (228 productive)2026-07-22: 228 productive2026-07-23: 310 sessions (271 productive)2026-07-23: 271 productive2026-07-24: 239 sessions (187 productive)2026-07-24: 187 productive2026-07-25: 367 sessions (256 productive)2026-07-25: 256 productive2026-07-26: 249 sessions (235 productive)2026-07-26: 235 productive2026-07-27: 17 sessions (16 productive)2026-07-27: 16 productive + + 2026-06-272026-07-27 + + +
+ Total sessions  + Productive  + Quality score (right y) +
+
+ +
+

Productivity by model × harness

+

+ Productive rate and LLM judge quality score per model+harness combination + (min 8 sessions, last 30 days). + claude-code   + codex   + gptme +

+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Harness:ModelProductive rate%ScoreSessions
claude-code:Sonnet 4.6 +
+
87.8%0.554,237
claude-code:Haiku 4.5 +
+
95.5%797
claude-code:Sonnet (old) +
+
52.2%0.57722
codex:GPT-5.5 +
+
98.8%0.49521
gptme:GPT-5.6 (sub) +
+
54.2%330
claude-code:Opus +
+
94.1%0.42256
codex:GPT-5.4 +
+
96.6%0.51234
gptme:GPT-5.6 +
+
93.6%0.53233
gptme:DeepSeek V4 +
+
85.4%233
gptme:DeepSeek V4 +
+
74.3%0.46101
claude-code:Haiku (old) +
+
67.0%0.6997
claude-code:Fable 5 +
+
98.8%0.7285
+
+
+ + + +