Agent Fleet & LLM harness 🐕🦺
Benching Harness - Leaderboard / PawBench / ChatGPT / What Is a Harness?
see also
- Superpowers - a complete software development methodology for your coding agents, built on top of a set of composable skills and some initial instructions that make sure your agent uses them.
- Munder Difflin – Agent harness to run an office of your clones / HN
- Hermes Kanban
- Kanban
- Gemini 3.7 Flash, Grok 4.6, GLM-5.3 and DeepSeek V4 Pro joined the frontier - Intelligence Index vs. Cost per Intelligence Index Task f
# Ranking
# KV Cache
Gestion du cache par les differents Harness au 2026-09-25 Le classement
- OpenFox - le score parfait. Plan en 19 secondes, skill et MCP ajoutés sans invalider le cache, accès instantané au secret, compactage nickel. Le meilleur harnais pour l’IA locale, et la vidéo explique pourquoi.
- OpenCode 2.0 - excellent, quasi parfait. Aucune invalidation sur tout le scénario, accès instantané partout. Seul bémol : le prompt de compactage remplace le dernier message utilisateur. Sinon, score parfait.
- DeepSeek Harness- très prometteur. Cache parfaitement respecté, compactage nickel, injection intelligente de la différence dans le contexte. Il ne manque que la gestion des skills pour un score parfait.
- Codex et QwenCode - fluides au quotidien, mais un compactage effroyable qui détruit le préfixe du cache au pire moment.
- Claude Code - 2.5/5. Des requêtes bizarres (dont un prompt AFK), un MCP qui échoue, pas d’accès instantané. Inutilisable en l’état sans proxy.
- Cline- l’ancien champion déchu. D’une première place à l’avant-dernière : invalidation totale au build, AGENTS.md injecté dans le système prompt.
- Pi - la boîte à Lego. Tout est à construire à la main, et le cache ne tient pas au passage plan vers build.
- Goose - la découverte du jour, maintenu sous l’égide de la Linux Foundation. Beaucoup de bugs, mais tous résolvables avec un peu de réflexion et de travail.
Written on August 22, 2026, Last update on September 2, 2026
agentic-AI
harness
kanban