↩ Radar · Radar
RADAR — roadmap de auto-atualização do livro vivo
Mantido por um agente agendado (1×/dia) sob o contrato de
AGENTE.md. Itens daqui não entram no livro automaticamente: promover = abrir feature spec-kit com curadoria humana (ADR 0008).
⚠ Leituras executivas possivelmente invalidadas
-
Cap. 04 (Compactação)— confrontada e MANTIDA na rodada ext-4 (spec 082), com ressalva registrada no capítulo: a leitura do código mostrou que a compactação não foi eliminada nem enfraquecida (as 1.398 linhas herdadas do Pi seguem lá, melhoradas), e sim subordinada ao agente (compact.run()agenda em vez de executar). O anúncio dizia uma coisa; o código, outra. Contexto original: o Prime Agent argumenta que "fixed tool-calling schemas and context compaction force the model to work around its own scaffolding instead of leveraging it" e propõe contexto como variável num REPL persistente: a compactação continua existindo, mas rebaixada a faxina do contexto principal — o histórico completo (inclusive compactações passadas) segue acessível por programa. A Leitura executiva do cap. 04 apresenta compactação como a resposta à janela de contexto. Verificar na leitura de código (rodada ext-4) antes de reescrever. -
Cap. 06 (MCP)tratada na spec 060 (edição 0.55) — a spec 2026-07-28 removeu o handshakeinitializee oMcp-Session-Id(núcleo stateless), depreciou Sampling/Roots/Logging e o transporte HTTP+SSE, e substituiu elicitation/sampling por MRTR. A Leitura executiva atual celebra exatamente o que foi depreciado. → promover a spec de revisão (impacto A; ver diário 2026-07-31). -
Cap. 16 (Auto-melhoria) — qualificada em 2026-08-07, não invalidada: a linha de auto-evolução do harness (HarnessX, Continual Harness, DemoEvolve) ganhou contraditório com exigência metodológica — arXiv 2607.12227 mostra que, sob orçamento pareado, a evolução automática não supera test-time scaling simples, e que os ganhos podem ser artefato do modo de avaliar. A seção precisa registrar os dois lados.
-
Cap. 10 (Subagentes) — qualificada em 2026-08-07: worktree isola arquivos por construção; o repositório git só passou a ser isolado depois de duas correções do Claude Code (v2.1.214, 18/jul, e v2.1.222, 04/ago). A síntese se mantém com a ressalva.
Itens
| Data | Item (com link) | Capítulo | Impacto | Ação sugerida | Status |
|---|---|---|---|---|---|
| 2026-08-07 | ⭐⭐ Meta lança o Muse Code (05/ago) — agente de terminal com subagentes de fundo persistentes, cada um em workspace isolado, e event log local à prova de crash, movido pelo Muse Spark 1.2. Fechado: binário proprietário por script, sem repositório público. Cobertura de 1ª linha (Bloomberg · CNBC · The Register); ⏳ primária da Meta bloqueada pelo egresso | 01 §4, 14, 15, apêndice supply-chain | B | terceiro caso do padrão "modelo aberto, harness fechado" (Z.ai 02/ago; Moonshot abriu; Meta fecha) — e o mais agudo, porque contradiz a estratégia da própria casa: abrir o modelo e fechar o harness só faz sentido se o valor migrou para o scaffolding, que é a tese do livro. Reprova no teste de inclusão (fechado) | novo |
| 2026-08-07 | Segunda survey do campo: Agent Systems with Harness Engineering (RUCAIBox / Renmin University), OpenReview nM5tDHrQsx — 502 referências, taxonomia em 4 eixos (evolução · design do harness · adaptação do modelo · benchmarks), atualizada 2026-05-19. Distinta do survey de Meng et al. (04/ago) |
01 §6, 14, bibliografia | B | o argumento de que o campo existe deixa de depender de uma fonte: duas surveys independentes, grupos e taxonomias diferentes. Confronto agora é a três — nossas 12 dimensões × H=(E,T,C,S,L,V) × os 4 eixos do RUCAIBox | novo |
| 2026-08-07 | Contraditório da auto-evolução: Rethinking the Evaluation of Harness Evolution for Agents — sob orçamento de feedback/inferência pareado, a evolução automática do harness não supera test-time scaling simples (Terminal-Bench 2.1, GPT-5.4, Claude Opus 4.6) e generaliza mal, porque busca e avaliação dividem o mesmo benchmark ⏳ abstract não lido na primária (arxiv.org bloqueado pelo egresso) · vizinhos: TTHE, Scaling Laws for Agent Harnesses |
16, 11 | B | o Radar vinha acumulando um lado só (HarnessX +14,5%, Continual Harness, DemoEvolve, Observability-Driven). A seção do cap. 16 não pode citar só os ganhos — e o paper entrega um critério adotável: comparar contra test-time scaling sob orçamento pareado | novo |
| 2026-08-07 | ❌ "Gemini CLI encerrado em 18/jun, substituído pelo Antigravity CLI fechado, cota gratuita de 1.000→~20/dia" (The New Stack + blogs de SEO) — a primária desmente: repo Apache 2.0, não arquivado, 6.344 commits, releases semanais; o README documenta o free tier vivo em "60 requests/min and 1,000 requests/day", sem aviso de migração | Apêndice A, 14 | — | descarte metodológico: alegação específica, plausível e que confirmava um preconceito (o caso opencode/Anthropic de 04/ago) — a pior combinação. Segundo dia seguido em que notícia espetacular sobre sistema do corpus se dissolve na verificação | descartado (desmentido pelo repositório em 2026-08-07) |
| 2026-08-06 | ⭐⭐ Prime Agent (Prime Intellect) — MIT, TS, 2.806★/208 forks (13,5:1 ✓), criado mai/2026, push hoje. RLM: contexto como variável e subagente como chamada de função num REPL persistente; Continual Harness: prompts/skills/memória/subagentes em CRUD pelo próprio agente; mensagens entre sessões. Reivindica 95,5% no ARC-AGI-3 ⏳ (scorecard de 3º existe, não conferido) | 04, 03, 10, 16, 01 §4, apêndice supply-chain | A | avaliado na rodada ext-4: 31/36; cap. 04 mantido com ressalva; dimensão 13 tem novo teto (Continual Harness); 5º consumidor do Pi na cadeia de suprimentos | promovido (spec 082) |
| 2026-08-06 | ⭐ Claw Code — vendido por press release pago como "framework de agente com 72k estrelas"; a API do GitHub mostra 194.982 estrelas para 109.281 forks (razão 1,8:1) e a auto-descrição "agent-managed museum exhibit… no human intervention" | 01 §4, 14 | B | caso concreto de por que estrelas não são evidência — o teste de inclusão como defesa (cap. 01 §4) e a inflação da categoria (14) | descartado como candidato; mantido como achado editorial |
| 2026-08-06 | AAIF (Linux Foundation) formada em dez/2025, ancorada por MCP + goose + AGENTS.md; A2A foi à LF em jun/2025 e tem working group na AAIF ⏳ o "150+" aparece para AAIF e A2A em fontes distintas | 17, Apêndice A | B | precisar a frase de governança do cap. 17; goose (membro do corpus) é projeto-âncora de fundação — muda seu status no Apêndice A | novo |
| 2026-08-06 | ⭐ Claude Code e o isolamento por worktree: duas correções, não uma — v2.1.214 (18/jul) fechou o desvio do git por git -C/--git-dir/GIT_DIR, e v2.1.222 (04/ago) fechou o resto ("isolation now applies to file edits and Bash in every session type"). Junto, a v2.1.221 traz oito furos de verificação de permissão — inclusive diálogo de aprovação escondendo parte do comando com tabs/Unicode invisível, e escape do sandbox de workflow por import() dinâmico |
10, 07, Apêndice A | B | qualifica a síntese do cap. 10 (worktree isola arquivos; o repositório git só depois de duas correções) e dá ao cap. 07 evidência oficial, datada e citável de que permissão é o componente mais difícil de acertar | confirmado em 2026-08-07 no changelog oficial (era ⏳ de rastreador) |
| 2026-08-06 | ⏳ Meta e um framework de agente chamado Harness (Alexandr Wang, YC Startup School 2026) — pode ser o Muse Code sob outro nome, ou o multi-agent harness que a cobertura diz estar por vir (ver linha de 07/ago) · Meta-Harness (Stanford IRIS) e Omnigent são coisas distintas de nome parecido | 01, 14, 16 | B se confirmado | o nome importa: seria a 4ª big tech a batizar um produto de "harness". Primária da Meta (ai.meta.com, dev.meta.ai) bloqueada pelo egresso em 07/ago |
avaliando (sem fonte primária) |
| 2026-08-05 | ⭐ Microsoft Agent Harness em GA (22/jul), anunciado no BUILD 2026 (2–3/jun) — define harness como "the scaffolding that turns a language model into an agent", a mesma definição do cap. 01; traz conectores p/ Claude Agent SDK e Copilot SDK | 01, 14, apêndice supply-chain, benchmark | B | citar a convergência independente de definição (01/14); elo novo no apêndice; candidato a frameworks na rodada 2026-10 ⏳ separar GA do framework (abr) do GA do harness (jul) | novo |
| 2026-08-05 | SandboxEscapeBench — ICML 2026 Oral (Oxford + UK AI Security Institute), código aberto: 18 cenários de escape em 3 camadas, modelos de fronteira escapam quando há vulnerabilidade, ~US$ 1 por tentativa | 07, 11 | B | o eval comportamental de segurança que nenhum dos 20 do corpus tem — torna a crítica do cap. 11 verificável; bibliografia sem ressalva (ICML) | novo |
| 2026-08-05 | Segurança de execução vira subcampo: Balkanization (39 papers, 17 categorias, 4 CVEs confirmados em harnesses de produção) · Lingering Authority / PORTICO (capabilities revogáveis por época) · IssueTrojanBench · Setup Complete | 07, 11 | B | CVEs reais dão base factual ao cap. 07; PORTICO conversa com o modelo de autoridade do IronClaw | novo |
| 2026-08-04 | ⭐ Stop Comparing LLM Agents Without Disclosing the Harness — Binding Constraint Thesis: variância do harness > variância do modelo, com inversão de ranking; propõe padrão de disclosure | 00, 01, 11 | B | citação de peso para a tese central; requisito de eval (disclosure) que nenhum membro do corpus cumpre — seção no cap. 11 | novo |
| 2026-08-04 | Survey do campo confirmado: Agent Harness for LLM Agents: A Survey (Meng et al., 2026) — H=(E,T,C,S,L,V), 110+ papers, 23 sistemas, Harness Completeness Matrix; DOI 10.20944/preprints202604.0428.v3 (Preprints.org, não arXiv) | 01 §6, 14, bibliografia | B | leitura dirigida com confronto de taxonomia (matriz deles × nossas 12 dimensões) | novo |
| 2026-08-04 | Anthropic revogou o uso de assinatura Pro/Max por terceiros (ToS fev/2026) e o opencode removeu o plugin por pedido legal (PR #18186, mar/2026) — atinge opencode e OpenClaw | apêndice supply-chain, 12, Apêndice A | B | lacuna retroativa: o apêndice (0.68) trata o risco da cadeia como hipótese, mas o caso já ocorreu — e vem do provedor de modelo, um andar acima dos harnesses | novo |
| 2026-08-04 | HarnessX (MIT, arXiv:2606.14249) — foundry com álgebra de substituição e evolução por traces, +14,5% médio (até +44%) em 5 benchmarks · DemoEvolve · Harness Handbook | 16, 12, 01 §4 | B | teste de inclusão na rodada 2026-10 (provável categoria frameworks); seção de auto-evolução no cap. 16 | novo |
| 2026-08-03 | Microsoft Agent Framework: "Agent Harness" no BUILD 2026 — big tech adotando o vocabulário ⏳ data a precisar | 01, 14, benchmark | B | — | datado em 2026-08-05 (ver linha do dia): BUILD 2–3/jun, GA do harness 22/jul |
| 2026-08-03 | Papers: Code as Agent Harness · Recursive Agent Harnesses · DeltaBox · ClawVM · Categorical Architecture · CAAF · Runtime Harness Adaptation | 04, 07, 08, 10, 11, 14 | C | leitura dirigida na rodada 2026-10; SandboxEscapeBench saiu desta linha: identificado e promovido a item próprio em 2026-08-05. O survey saiu desta linha: virou item próprio em 2026-08-04, com DOI | novo |
| 2026-08-03 | ⏳ opencode teria perdido login por assinatura Claude Pro/Max — só em agregador | Apêndice supply-chain, 12, Apêndice A | B | — | confirmado em 2026-08-04 (ver linha do dia): fato é de jan–mar/2026, o agregador datou errado |
| 2026-08-02 | Traycer — cockpit de orquestração de 18 harnesses, indicado pelo editor; avaliado na rodada ext-3 (18/36): clientes/protocolo abertos, Host+nuvem fechados | 01 §4, 09, 14, apêndice supply-chain | B | registro da recusa + mapa de supply chain aproveitado no apêndice novo | descartado (teste de inclusão: motor fechado/SaaS; spec 074) |
| 2026-08-02 | ZCode (Z.ai) — "Agentic Development Environment" para o GLM-5.2 | 01 §4, 15, 14 | B→C | candidatura ao corpus caiu (2026-08-03: o app é gratuito porém fechado; MIT é só o modelo); permanece como sinal do cap. 14 — 3º vendor verticalizando, com estratégia de abertura oposta | descartado (harness fechado; sinal mantido no 14) |
| 2026-08-02 | Aider: última minor v0.86.0 (ago/2025); 2026-08-03: v0.86.2 há ~3 meses, mantido pela comunidade — cadência só de patches há 1 ano, não dormência | Apêndice A, 14 | C | nota de status no Apêndice A na rodada 2026-10 (primeiro membro do corpus em manutenção lenta); avaliação congelada permanece válida | avaliando (cadência confirmada 2026-08-03) |
| 2026-08-02 | Papers: Parallel Context Compaction · ContextBudget · Exploratory Study · Observability-Driven Harness Evolution | 03, 04, 16 | C | leitura dirigida na rodada 2026-10; candidatos à bibliografia | novo |
| 2026-08-02 | Kimi Code (Moonshot AI) — harness MIT em TypeScript, achado na leitura crítica de artigo de divulgação da Kimi e verificado na fonte; segundo vendor de modelo verticalizando no harness | 01 §4, 14, Apêndice A | B | avaliado na rodada ext-2 (32/36) | promovido (spec 073) |
| 2026-08-01 | MCP 2026-07-28: adoção imediata — Claude em rollout, 4 SDKs Tier-1 no dia, gateway AWS com tradução de versão | 06, 17 | B | dados de adoção para a matriz (rodada 2026-10); avaliar nota sobre o padrão "gateway tradutor" no cap. 06 | novo |
| 2026-08-01 | QM (Y Combinator) — harness multi-agente MIT p/ Slack/web; repo confirmado em anúncio oficial da YC (2026-08-02): triggers, memória compartilhada, conectores, loops de código plugáveis | 01 §4, 08, 10, 13 | B | avaliado na rodada ext-2 (31/36) — inaugurou a categoria agentes organizacionais | promovido (spec 073) |
| 2026-08-01 | Papers: The Context Fails First (contexto como indicador líder, 7 critérios) · Architectural Design Decisions in AI Agent Harnesses (70 projetos) | 03, 11, 01/14 | B/C | leitura dirigida (arXiv acessível); candidatos à bibliografia | novo |
| 2026-08-01 | A2A: 1º ano — 150+ orgs, embutido em Azure/Bedrock/Vertex (fonte primária LF) | 17 | C | dado para a matriz de adoção da rodada 2026-10 | novo |
| 2026-08-01 | Corpus, rotina: Grok Build retoma sessões de Claude/Codex/Cursor + /tutorial · Pi ganha provedor xAI via pacote (pi-xai-oauth) · versões: CC 2.1.220, Codex 0.146.0, gemini-cli 0.53.0 |
12, 14, Apêndice A | C | refresh do Apêndice A na rodada 2026-10 | novo |
| 2026-07-31 | Grok Build (xAI) open source, Apache 2.0 — harness completo com subagentes paralelos em git worktrees, AGENTS.md, skills/hooks/MCP | 01 §4, 10, Apêndice A | B | teste de inclusão no corpus na rodada 2026-10; nota worktrees no cap. 10 | promovido (spec 064) |
| 2026-07-31 | Pi (Earendil/Ronacher) — harness minimalista: system prompt <1k tokens, 4 tools, lazy skills, sem MCP/subagentes | 03, 12, 01 §4 | B | candidato ao corpus; caixa de contraste "o harness mínimo" no cap. 03 | promovido (spec 064) |
| 2026-07-31 | Papers: Harness Evolution eval · CompactionRL · survey Harness Engineering (RUCAIBox) — survey lido na íntegra (é de maio/2026, OpenReview, sem arXiv); os dois arXiv avaliados pelo abstract (arXiv bloqueado no ambiente — leitura integral na janela 2026-10) | 04, 11, bibliografia | B/C | adendos nos caps. 04 e 11 + 3 itens na bibliografia | promovido (spec 065) |
| 2026-07-31 | Evolução do corpus: Claude Code (/fork, Opus 5 1M) · Codex (plugins interop) · gemini-cli v0.53 (caretakers, eval coverage) | 11, 14, 16, Apêndice A | C | refresh do Apêndice A na rodada 2026-10; sinal de convergência (plugins) no 14 | novo |
| 2026-07-31 | A2A v1.0 estável (Linux Foundation), v1.0.1 com extensões | 17 | C | conferido: a tabela do cap. 17 já dizia "v1.0 em 2026"; adendo enriquecido (3 camadas, v1.0.1/extensões, fonte primária) | conferido (spec 065) |
| 2026-07-31 | MCP spec 2026-07-28 — núcleo stateless, MRTR, extensões, cache ttlMs, depreciações (Sampling/Roots/Logging/SSE/DCR) | 06 (A), 17 (B), etapa 07 (B), 03/04 (C) | A | revisar cap. 06 (lifecycle/Leitura executiva), nota no 17 e na etapa 07 | promovido (spec 060) |
| 2026-07-29 | (inicial) Radar criado; primeira varredura na próxima execução agendada | — | — | — | novo |