Apêndice — O estudo: harnesses avaliados
Este apêndice mostra o trabalho executado: a lista completa dos harnesses que passaram pelo estudo, com de onde vieram (repositório de origem), a foto exata que foi lida (fork/commit/snapshot — a materialização da data de corte do método, cap. 01 §6) e o link para a avaliação completa de cada um. O instrumento usado em todas as avaliações é o mesmo: o template HARNESS_EVAL.md (e FRAMEWORK_EVAL.md para frameworks), aplicado por leitura sistemática de código conforme a metodologia do benchmark.
Como ler esta tabela
- Origem: o repositório upstream público.
- Versão/snapshot: a versão ou o snapshot lido.
- Fork/commit (data de corte): a foto congelada no fork
GHDaru/*— é o que garante reprodutibilidade (qualquer pessoa pode ler o mesmo commit) e materializa a mitigação de obsolescência do método. Os forks são sincronizados pelo scriptscripts/sync-forks.ps1. - Avaliação: o documento completo (metadados, notas por dimensão com evidência de código, diagnóstico e "o que roubar").
Os 16 avaliados
| Harness | Categoria | Origem | Versão/snapshot | Fork/commit lido | Avaliado em | Análise |
|---|---|---|---|---|---|---|
| Aider | harnesses de código | github.com/Aider-AI/aider | snapshot 2026-07 | fork GHDaru/aider, commit 5dc9490 | 2026-07-24 (rodada 2) | avaliação |
| Codex CLI (OpenAI) | harnesses de código | github.com/openai/codex | snapshot 2026-07 | fork GHDaru/codex, commit 000d254 | 2026-07-24 (rodada 2) | avaliação |
| gemini-cli | harnesses de código | github.com/google-gemini/gemini-cli | snapshot 2026-07 (main) | — | 2026-07-24 (rodada 1, exploratória) | avaliação |
| Goose (Block / AAIF) | harnesses de código | github.com/block/goose | v1.44.0 | fork GHDaru/goose, commit 0038bc7 | 2026-07-24 (rodada 2) | avaliação |
| opencode | harnesses de código | github.com/anomalyco/opencode | v1.18.4 (V2 em transição, documentada em CONTEXT.md) |
— | 2026-07-24 (rodada 1, exploratória) | avaliação |
| OpenHands (Agent Canvas) | harnesses de código | github.com/All-Hands-AI/OpenHands | snapshot 2026-07 | fork GHDaru/OpenHands, commit 6b04532 | 2026-07-24 (rodada 2) | avaliação |
| OpenHarness | harnesses de código | github.com/HKUDS/OpenHarness | v0.1.9 | — | 2026-07-24 (rodada 1, exploratória) | avaliação |
| Hermes Agent (Nous Research) | agentes pessoais self-hosted | github.com/NousResearch/hermes-agent | snapshot 2026-07 | fork GHDaru/hermes-agent, commit 55ef425 | 2026-07-24 (rodada 2) | avaliação |
| IronClaw (NEAR AI) | agentes pessoais self-hosted | github.com/nearai/ironclaw | snapshot 2026-07 | fork GHDaru/ironclaw, commit 073ded0 | 2026-07-24 (rodada 2) | avaliação |
| ohmo (OpenHarness) | agentes pessoais self-hosted | github.com/HKUDS/OpenHarness (diretório ohmo/) |
v0.1.9 — avaliação dedicada, complementar à do OpenHarness (rodada 1) | — | 2026-07 | avaliação |
| OpenClaw | agentes pessoais self-hosted | github.com/openclaw/openclaw | snapshot 2026-07 | fork GHDaru/openclaw, commit 1e15b18b | 2026-07-24 (rodada 2) | avaliação |
| n8n (nó AI Agent) | harnesses embutidos | github.com/n8n-io/n8n | snapshot 2026-07; pacote avaliado: packages/@n8n/nodes-langchain v2.32.0 (135 nós de IA) |
fork GHDaru/n8n, commit 55e92cc2 | 2026-07-24 (rodada 2) | avaliação |
| CrewAI | frameworks | github.com/crewAIInc/crewAI | v1.15.6 — monorepo com 6 pacotes (crewai, crewai-core, crewai-tools ~79 tools, cli, crewai-files, devtools) |
fork GHDaru, commit b3aaaab | 2026-07 | avaliação |
| LangGraph | frameworks | github.com/langchain-ai/langgraph | langgraph 1.2.9 — monorepo: core (~28k LOC), prebuilt, checkpoint (+postgres/sqlite/conformance), cli, sdk-py; ~63k LOC de testes (2,3× o código) | fork GHDaru, commit 1e1ca88 | 2026-07 | avaliação |
| OpenAI Agents SDK | frameworks | github.com/openai/openai-agents-python | v0.18.3 | fork GHDaru, commit 5976333 | 2026-07 | avaliação |
| Software Agent SDK (OpenHands) | frameworks | github.com/OpenHands/software-agent-sdk | v1.37.1 | fork GHDaru, commit 99342c4 | 2026-07 | avaliação |
Extensão ext-1 (2026-07-31): a primeira promoção Radar→corpus
O corpus cresceu de 16 para 18 pelo caminho que o próprio livro institucionalizou: o Radar diário encontrou os candidatos (varredura de 2026-07-31), o editor aprovou a promoção, os repositórios foram forkados para leitura congelada e o mesmo instrumento (HARNESS_EVAL.md) foi aplicado — rodada ext-1, sem tocar as fotos das rodadas 1/2. Ambos passam o teste de inclusão do cap. 01 §4 (código aberto + harness de propósito geral + adoção/representatividade): o Grok Build pela abertura de um harness comercial completo; o Pi como caso deliberadamente atípico (a lógica de replicação de Yin pedia um contraponto minimalista, e faltava um no corpus).
| Harness | Categoria | Origem | Versão/snapshot | Fork/commit lido | Avaliado em | Análise |
|---|---|---|---|---|---|---|
| Grok Build (xAI) | harnesses de código | github.com/xai-org/grok-build | snapshot 2026-07 (aberto em 2026-07-15, Apache 2.0) | fork GHDaru/grok-build, commit dd04f39 | 2026-07-31 (rodada ext-1) | avaliação |
| Pi (Earendil Labs) | harnesses de código | github.com/badlogic/pi-mono | snapshot 2026-07-31 | fork GHDaru/pi, commit 7846534 | 2026-07-31 (rodada ext-1) | avaliação |
Extensão ext-2 (2026-08-02): a segunda promoção — e uma categoria nova
O corpus cresceu de 18 para 20 pelo mesmo caminho: o Radar confirmou o QM em fonte primária (varredura de 2026-08-02) e a leitura crítica de um artigo de divulgação levou ao Kimi Code, verificado na fonte; o editor aprovou, os repositórios foram forkados e o instrumento aplicado — rodada ext-2. O Kimi Code entra pelo mesmo critério do Grok Build (segundo vendor de modelo abrindo um harness completo — o padrão virou tendência, cap. 14). O QM não coube em nenhum arquétipo existente e inaugura a categoria "agentes organizacionais": a unidade de design é a organização (escopos, permissões por audiência, consentimento, auditoria), e o loop do agente é um motor trocável — inclusive o próprio Pi, avaliado na ext-1, é aqui uma dependência (package.json). A lógica de replicação de Yin pedia exatamente isso: um caso que testasse o limite da taxonomia.
| Harness | Categoria | Origem | Versão/snapshot | Fork/commit lido | Avaliado em | Análise |
|---|---|---|---|---|---|---|
| Kimi Code (Moonshot AI) | harnesses de código | github.com/MoonshotAI/kimi-code | CLI 0.31.1 (aberto em ~2026-06, MIT) | fork GHDaru/kimi-code, commit e22479a | 2026-08-02 (rodada ext-2) | avaliação |
| QM (Y Combinator) | agentes organizacionais | github.com/yc-software/qm | snapshot 2026-07-31 (aberto em 2026-07-31, MIT) | fork GHDaru/qm, commit 7f2c916 | 2026-08-02 (rodada ext-2) | avaliação |
Extensão ext-3 (2026-08-02): avaliado e não incluído — o teste de inclusão funcionando
O método também documenta as recusas. O Traycer (Traycer AI) foi indicado pelo editor, forkado e avaliado com o instrumento completo (fork GHDaru/traycer, commit 65fc3d7, MIT) — e não passou o teste de inclusão do cap. 01 §4: o repositório aberto (~513 mil linhas) contém clientes, CLI e um protocolo de orquestração notável, mas nenhuma das quatro peças do harness — o Host que executa loop, contexto, ferramentas e controle é binário fechado assinado, com nuvem obrigatória (o AGENTS.md do próprio repo declara que Host e backends não estão ali). A avaliação completa (18/36) fica como registro: é o caso mais bem documentado do estudo de "open source" como estratégia de distribuição de cliente, e a evidência central do novo Apêndice — A cadeia de suprimentos, para o qual a leitura rendeu o mapa de 18 harnesses orquestrados.
Extensão ext-4 (2026-08-06): o corpus vai a 21 — e a primeira síntese confrontada
O Prime Agent (Prime Intellect) chegou por indicação do editor no mesmo dia do anúncio e foi o primeiro candidato a ameaçar uma Leitura executiva em vez de acrescentar um adendo: o lançamento afirma que a compactação de contexto "força o modelo a contornar o próprio scaffolding". A leitura do código manteve a síntese do cap. 04 e registrou uma ressalva — a compactação não foi eliminada, foi subordinada ao agente (ver cap. 04).
O achado estrutural da rodada é outro: o Prime Agent é construído sobre o Pi — mesmos quatro pacotes, LICENSE com dupla titularidade (Mario Zechner + Prime Intellect), README creditando o pi-mono. É o quinto consumidor do Pi registrado no apêndice da cadeia de suprimentos, e fecha um argumento do cap. 12: o sistema de menor nota do corpus (Pi, 26/36 — que recusa metade das dimensões por manifesto) foi a base escolhida por um laboratório de fronteira para construir o harness mais radical do estudo.
| Harness | Categoria | Origem | Versão/snapshot | Fork/commit lido | Avaliado em | Análise |
|---|---|---|---|---|---|---|
| Prime Agent (Prime Intellect) | harnesses de código | github.com/PrimeIntellect-ai/prime-agent | workspace 0.7.0 (MIT) | fork GHDaru/prime-agent, commit 0e0d233 | 2026-08-06 (rodada ext-4) | avaliação |
Diagnóstico consolidado
Os resultados por dimensão (notas 0–3, com evidência) e o diagnóstico comparativo estão no Comparativo dos Harnesses — incluindo o heatmap interativo. Cada avaliação individual traz, além das notas: o arquétipo observado do harness, os pontos fortes com caminhos de arquivo, e a seção "o que roubar" (padrões que merecem ser levados para outros harnesses).
Nota de método (cap. 01 §6): a seleção seguiu lógica de replicação (Yin) — casos representativos e deliberadamente atípicos; a unidade de análise é o código-fonte; as notas seguem a grade fixa do template (feature analysis, DESMET). O placar de expiração das previsões está no Histórico.
Consulte também: implementações de referência além das avaliadas aqui estão catalogadas em Awesome Harness Engineering — Reference Implementations.