↩ Radar · Radar

RADAR — roadmap de auto-atualização do livro vivo

Mantido por um agente agendado (1×/dia) sob o contrato de AGENTE.md. Itens daqui não entram no livro automaticamente: promover = abrir feature spec-kit com curadoria humana (ADR 0008).

⚠ Leituras executivas possivelmente invalidadas

  • Cap. 04 (Compactação)confrontada e MANTIDA na rodada ext-4 (spec 082), com ressalva registrada no capítulo: a leitura do código mostrou que a compactação não foi eliminada nem enfraquecida (as 1.398 linhas herdadas do Pi seguem lá, melhoradas), e sim subordinada ao agente (compact.run() agenda em vez de executar). O anúncio dizia uma coisa; o código, outra. Contexto original: o Prime Agent argumenta que "fixed tool-calling schemas and context compaction force the model to work around its own scaffolding instead of leveraging it" e propõe contexto como variável num REPL persistente: a compactação continua existindo, mas rebaixada a faxina do contexto principal — o histórico completo (inclusive compactações passadas) segue acessível por programa. A Leitura executiva do cap. 04 apresenta compactação como a resposta à janela de contexto. Verificar na leitura de código (rodada ext-4) antes de reescrever.

  • Cap. 06 (MCP) tratada na spec 060 (edição 0.55) — a spec 2026-07-28 removeu o handshake initialize e o Mcp-Session-Id (núcleo stateless), depreciou Sampling/Roots/Logging e o transporte HTTP+SSE, e substituiu elicitation/sampling por MRTR. A Leitura executiva atual celebra exatamente o que foi depreciado. → promover a spec de revisão (impacto A; ver diário 2026-07-31).

  • Cap. 16 (Auto-melhoria)qualificada em 2026-08-07, não invalidada: a linha de auto-evolução do harness (HarnessX, Continual Harness, DemoEvolve) ganhou contraditório com exigência metodológica — arXiv 2607.12227 mostra que, sob orçamento pareado, a evolução automática não supera test-time scaling simples, e que os ganhos podem ser artefato do modo de avaliar. A seção precisa registrar os dois lados.

  • Cap. 10 (Subagentes)qualificada em 2026-08-07: worktree isola arquivos por construção; o repositório git só passou a ser isolado depois de duas correções do Claude Code (v2.1.214, 18/jul, e v2.1.222, 04/ago). A síntese se mantém com a ressalva.

Itens

Data Item (com link) Capítulo Impacto Ação sugerida Status
2026-08-07 ⭐⭐ Meta lança o Muse Code (05/ago) — agente de terminal com subagentes de fundo persistentes, cada um em workspace isolado, e event log local à prova de crash, movido pelo Muse Spark 1.2. Fechado: binário proprietário por script, sem repositório público. Cobertura de 1ª linha (Bloomberg · CNBC · The Register); ⏳ primária da Meta bloqueada pelo egresso 01 §4, 14, 15, apêndice supply-chain B terceiro caso do padrão "modelo aberto, harness fechado" (Z.ai 02/ago; Moonshot abriu; Meta fecha) — e o mais agudo, porque contradiz a estratégia da própria casa: abrir o modelo e fechar o harness só faz sentido se o valor migrou para o scaffolding, que é a tese do livro. Reprova no teste de inclusão (fechado) novo
2026-08-07 Segunda survey do campo: Agent Systems with Harness Engineering (RUCAIBox / Renmin University), OpenReview nM5tDHrQsx502 referências, taxonomia em 4 eixos (evolução · design do harness · adaptação do modelo · benchmarks), atualizada 2026-05-19. Distinta do survey de Meng et al. (04/ago) 01 §6, 14, bibliografia B o argumento de que o campo existe deixa de depender de uma fonte: duas surveys independentes, grupos e taxonomias diferentes. Confronto agora é a três — nossas 12 dimensões × H=(E,T,C,S,L,V) × os 4 eixos do RUCAIBox novo
2026-08-07 Contraditório da auto-evolução: Rethinking the Evaluation of Harness Evolution for Agents — sob orçamento de feedback/inferência pareado, a evolução automática do harness não supera test-time scaling simples (Terminal-Bench 2.1, GPT-5.4, Claude Opus 4.6) e generaliza mal, porque busca e avaliação dividem o mesmo benchmark ⏳ abstract não lido na primária (arxiv.org bloqueado pelo egresso) · vizinhos: TTHE, Scaling Laws for Agent Harnesses 16, 11 B o Radar vinha acumulando um lado só (HarnessX +14,5%, Continual Harness, DemoEvolve, Observability-Driven). A seção do cap. 16 não pode citar só os ganhos — e o paper entrega um critério adotável: comparar contra test-time scaling sob orçamento pareado novo
2026-08-07 ❌ "Gemini CLI encerrado em 18/jun, substituído pelo Antigravity CLI fechado, cota gratuita de 1.000→~20/dia" (The New Stack + blogs de SEO) — a primária desmente: repo Apache 2.0, não arquivado, 6.344 commits, releases semanais; o README documenta o free tier vivo em "60 requests/min and 1,000 requests/day", sem aviso de migração Apêndice A, 14 descarte metodológico: alegação específica, plausível e que confirmava um preconceito (o caso opencode/Anthropic de 04/ago) — a pior combinação. Segundo dia seguido em que notícia espetacular sobre sistema do corpus se dissolve na verificação descartado (desmentido pelo repositório em 2026-08-07)
2026-08-06 ⭐⭐ Prime Agent (Prime Intellect)MIT, TS, 2.806★/208 forks (13,5:1 ✓), criado mai/2026, push hoje. RLM: contexto como variável e subagente como chamada de função num REPL persistente; Continual Harness: prompts/skills/memória/subagentes em CRUD pelo próprio agente; mensagens entre sessões. Reivindica 95,5% no ARC-AGI-3 ⏳ (scorecard de 3º existe, não conferido) 04, 03, 10, 16, 01 §4, apêndice supply-chain A avaliado na rodada ext-4: 31/36; cap. 04 mantido com ressalva; dimensão 13 tem novo teto (Continual Harness); 5º consumidor do Pi na cadeia de suprimentos promovido (spec 082)
2026-08-06 Claw Code — vendido por press release pago como "framework de agente com 72k estrelas"; a API do GitHub mostra 194.982 estrelas para 109.281 forks (razão 1,8:1) e a auto-descrição "agent-managed museum exhibit… no human intervention" 01 §4, 14 B caso concreto de por que estrelas não são evidência — o teste de inclusão como defesa (cap. 01 §4) e a inflação da categoria (14) descartado como candidato; mantido como achado editorial
2026-08-06 AAIF (Linux Foundation) formada em dez/2025, ancorada por MCP + goose + AGENTS.md; A2A foi à LF em jun/2025 e tem working group na AAIF ⏳ o "150+" aparece para AAIF e A2A em fontes distintas 17, Apêndice A B precisar a frase de governança do cap. 17; goose (membro do corpus) é projeto-âncora de fundação — muda seu status no Apêndice A novo
2026-08-06 ⭐ Claude Code e o isolamento por worktree: duas correções, não uma — v2.1.214 (18/jul) fechou o desvio do git por git -C/--git-dir/GIT_DIR, e v2.1.222 (04/ago) fechou o resto ("isolation now applies to file edits and Bash in every session type"). Junto, a v2.1.221 traz oito furos de verificação de permissão — inclusive diálogo de aprovação escondendo parte do comando com tabs/Unicode invisível, e escape do sandbox de workflow por import() dinâmico 10, 07, Apêndice A B qualifica a síntese do cap. 10 (worktree isola arquivos; o repositório git só depois de duas correções) e dá ao cap. 07 evidência oficial, datada e citável de que permissão é o componente mais difícil de acertar confirmado em 2026-08-07 no changelog oficial (era ⏳ de rastreador)
2026-08-06 Meta e um framework de agente chamado Harness (Alexandr Wang, YC Startup School 2026) — pode ser o Muse Code sob outro nome, ou o multi-agent harness que a cobertura diz estar por vir (ver linha de 07/ago) · Meta-Harness (Stanford IRIS) e Omnigent são coisas distintas de nome parecido 01, 14, 16 B se confirmado o nome importa: seria a 4ª big tech a batizar um produto de "harness". Primária da Meta (ai.meta.com, dev.meta.ai) bloqueada pelo egresso em 07/ago avaliando (sem fonte primária)
2026-08-05 Microsoft Agent Harness em GA (22/jul), anunciado no BUILD 2026 (2–3/jun) — define harness como "the scaffolding that turns a language model into an agent", a mesma definição do cap. 01; traz conectores p/ Claude Agent SDK e Copilot SDK 01, 14, apêndice supply-chain, benchmark B citar a convergência independente de definição (01/14); elo novo no apêndice; candidato a frameworks na rodada 2026-10 ⏳ separar GA do framework (abr) do GA do harness (jul) novo
2026-08-05 SandboxEscapeBenchICML 2026 Oral (Oxford + UK AI Security Institute), código aberto: 18 cenários de escape em 3 camadas, modelos de fronteira escapam quando há vulnerabilidade, ~US$ 1 por tentativa 07, 11 B o eval comportamental de segurança que nenhum dos 20 do corpus tem — torna a crítica do cap. 11 verificável; bibliografia sem ressalva (ICML) novo
2026-08-05 Segurança de execução vira subcampo: Balkanization (39 papers, 17 categorias, 4 CVEs confirmados em harnesses de produção) · Lingering Authority / PORTICO (capabilities revogáveis por época) · IssueTrojanBench · Setup Complete 07, 11 B CVEs reais dão base factual ao cap. 07; PORTICO conversa com o modelo de autoridade do IronClaw novo
2026-08-04 Stop Comparing LLM Agents Without Disclosing the HarnessBinding Constraint Thesis: variância do harness > variância do modelo, com inversão de ranking; propõe padrão de disclosure 00, 01, 11 B citação de peso para a tese central; requisito de eval (disclosure) que nenhum membro do corpus cumpre — seção no cap. 11 novo
2026-08-04 Survey do campo confirmado: Agent Harness for LLM Agents: A Survey (Meng et al., 2026) — H=(E,T,C,S,L,V), 110+ papers, 23 sistemas, Harness Completeness Matrix; DOI 10.20944/preprints202604.0428.v3 (Preprints.org, não arXiv) 01 §6, 14, bibliografia B leitura dirigida com confronto de taxonomia (matriz deles × nossas 12 dimensões) novo
2026-08-04 Anthropic revogou o uso de assinatura Pro/Max por terceiros (ToS fev/2026) e o opencode removeu o plugin por pedido legal (PR #18186, mar/2026) — atinge opencode e OpenClaw apêndice supply-chain, 12, Apêndice A B lacuna retroativa: o apêndice (0.68) trata o risco da cadeia como hipótese, mas o caso já ocorreu — e vem do provedor de modelo, um andar acima dos harnesses novo
2026-08-04 HarnessX (MIT, arXiv:2606.14249) — foundry com álgebra de substituição e evolução por traces, +14,5% médio (até +44%) em 5 benchmarks · DemoEvolve · Harness Handbook 16, 12, 01 §4 B teste de inclusão na rodada 2026-10 (provável categoria frameworks); seção de auto-evolução no cap. 16 novo
2026-08-03 Microsoft Agent Framework: "Agent Harness" no BUILD 2026 — big tech adotando o vocabulário ⏳ data a precisar 01, 14, benchmark B datado em 2026-08-05 (ver linha do dia): BUILD 2–3/jun, GA do harness 22/jul
2026-08-03 Papers: Code as Agent Harness · Recursive Agent Harnesses · DeltaBox · ClawVM · Categorical Architecture · CAAF · Runtime Harness Adaptation 04, 07, 08, 10, 11, 14 C leitura dirigida na rodada 2026-10; SandboxEscapeBench saiu desta linha: identificado e promovido a item próprio em 2026-08-05. O survey saiu desta linha: virou item próprio em 2026-08-04, com DOI novo
2026-08-03 ⏳ opencode teria perdido login por assinatura Claude Pro/Max — só em agregador Apêndice supply-chain, 12, Apêndice A B confirmado em 2026-08-04 (ver linha do dia): fato é de jan–mar/2026, o agregador datou errado
2026-08-02 Traycer — cockpit de orquestração de 18 harnesses, indicado pelo editor; avaliado na rodada ext-3 (18/36): clientes/protocolo abertos, Host+nuvem fechados 01 §4, 09, 14, apêndice supply-chain B registro da recusa + mapa de supply chain aproveitado no apêndice novo descartado (teste de inclusão: motor fechado/SaaS; spec 074)
2026-08-02 ZCode (Z.ai) — "Agentic Development Environment" para o GLM-5.2 01 §4, 15, 14 B→C candidatura ao corpus caiu (2026-08-03: o app é gratuito porém fechado; MIT é só o modelo); permanece como sinal do cap. 14 — 3º vendor verticalizando, com estratégia de abertura oposta descartado (harness fechado; sinal mantido no 14)
2026-08-02 Aider: última minor v0.86.0 (ago/2025); 2026-08-03: v0.86.2 há ~3 meses, mantido pela comunidade — cadência só de patches há 1 ano, não dormência Apêndice A, 14 C nota de status no Apêndice A na rodada 2026-10 (primeiro membro do corpus em manutenção lenta); avaliação congelada permanece válida avaliando (cadência confirmada 2026-08-03)
2026-08-02 Papers: Parallel Context Compaction · ContextBudget · Exploratory Study · Observability-Driven Harness Evolution 03, 04, 16 C leitura dirigida na rodada 2026-10; candidatos à bibliografia novo
2026-08-02 Kimi Code (Moonshot AI) — harness MIT em TypeScript, achado na leitura crítica de artigo de divulgação da Kimi e verificado na fonte; segundo vendor de modelo verticalizando no harness 01 §4, 14, Apêndice A B avaliado na rodada ext-2 (32/36) promovido (spec 073)
2026-08-01 MCP 2026-07-28: adoção imediata — Claude em rollout, 4 SDKs Tier-1 no dia, gateway AWS com tradução de versão 06, 17 B dados de adoção para a matriz (rodada 2026-10); avaliar nota sobre o padrão "gateway tradutor" no cap. 06 novo
2026-08-01 QM (Y Combinator) — harness multi-agente MIT p/ Slack/web; repo confirmado em anúncio oficial da YC (2026-08-02): triggers, memória compartilhada, conectores, loops de código plugáveis 01 §4, 08, 10, 13 B avaliado na rodada ext-2 (31/36) — inaugurou a categoria agentes organizacionais promovido (spec 073)
2026-08-01 Papers: The Context Fails First (contexto como indicador líder, 7 critérios) · Architectural Design Decisions in AI Agent Harnesses (70 projetos) 03, 11, 01/14 B/C leitura dirigida (arXiv acessível); candidatos à bibliografia novo
2026-08-01 A2A: 1º ano — 150+ orgs, embutido em Azure/Bedrock/Vertex (fonte primária LF) 17 C dado para a matriz de adoção da rodada 2026-10 novo
2026-08-01 Corpus, rotina: Grok Build retoma sessões de Claude/Codex/Cursor + /tutorial · Pi ganha provedor xAI via pacote (pi-xai-oauth) · versões: CC 2.1.220, Codex 0.146.0, gemini-cli 0.53.0 12, 14, Apêndice A C refresh do Apêndice A na rodada 2026-10 novo
2026-07-31 Grok Build (xAI) open source, Apache 2.0 — harness completo com subagentes paralelos em git worktrees, AGENTS.md, skills/hooks/MCP 01 §4, 10, Apêndice A B teste de inclusão no corpus na rodada 2026-10; nota worktrees no cap. 10 promovido (spec 064)
2026-07-31 Pi (Earendil/Ronacher) — harness minimalista: system prompt <1k tokens, 4 tools, lazy skills, sem MCP/subagentes 03, 12, 01 §4 B candidato ao corpus; caixa de contraste "o harness mínimo" no cap. 03 promovido (spec 064)
2026-07-31 Papers: Harness Evolution eval · CompactionRL · survey Harness Engineering (RUCAIBox) — survey lido na íntegra (é de maio/2026, OpenReview, sem arXiv); os dois arXiv avaliados pelo abstract (arXiv bloqueado no ambiente — leitura integral na janela 2026-10) 04, 11, bibliografia B/C adendos nos caps. 04 e 11 + 3 itens na bibliografia promovido (spec 065)
2026-07-31 Evolução do corpus: Claude Code (/fork, Opus 5 1M) · Codex (plugins interop) · gemini-cli v0.53 (caretakers, eval coverage) 11, 14, 16, Apêndice A C refresh do Apêndice A na rodada 2026-10; sinal de convergência (plugins) no 14 novo
2026-07-31 A2A v1.0 estável (Linux Foundation), v1.0.1 com extensões 17 C conferido: a tabela do cap. 17 já dizia "v1.0 em 2026"; adendo enriquecido (3 camadas, v1.0.1/extensões, fonte primária) conferido (spec 065)
2026-07-31 MCP spec 2026-07-28 — núcleo stateless, MRTR, extensões, cache ttlMs, depreciações (Sampling/Roots/Logging/SSE/DCR) 06 (A), 17 (B), etapa 07 (B), 03/04 (C) A revisar cap. 06 (lifecycle/Leitura executiva), nota no 17 e na etapa 07 promovido (spec 060)
2026-07-29 (inicial) Radar criado; primeira varredura na próxima execução agendada novo