Haarvisie verslagen
← Alle verslagen📄 Download als PDF
🎧 Luister dit verslag
1,0x
⬇️ Download naar telefoon
📖 Lees mee met de podcast

Hoi Jamal, welkom bij deze speciale update! Vandaag duiken we in een vraag die veel ontwikkelaars bezighoudt, en jou natuurlijk ook: welk agent-harnas werkt nu eigenlijk het beste met welk model? Ik heb de afgelopen tijd voor jou uitgezocht wat andere experts en testers hierover zeggen, met een focus op jouw Hermes-harnas, Codex, en de bredere vergelijking. En ik kan je alvast verklappen: er zitten een paar verrassende inzichten tussen die jouw aanpak wel eens kunnen veranderen!

Als je maar één ding onthoudt uit dit onderzoek, Jamal, dan is het dit: het harnas dat je kiest, kan net zo bepalend zijn voor het succes van je AI-agent als het onderliggende model zelf. Sterker nog, het kan zelfs méér verschil maken! Stel je voor, hetzelfde model door acht verschillende harnassen gehaald gaf een succespercentage dat varieerde van 68% tot wel 88%. Dat is twintig punten verschil, puur door het harnas!

Laten we beginnen met jouw favoriet: Hermes. Het "Hermes Agent" is een fantastisch open-source framework van Nous Research, perfect afgestemd op jouw multi-platform opzet met zijn CLI, TUI, desktop-app en integraties met Telegram, Discord en meer. Het mooie is dat Hermes bewust model-onafhankelijk is. De makers adverteren met toegang tot ruim 300 modellen, en het werkt met elke provider. En dat is ook precies de reden dat er geen publieke "beste model voor Hermes"-test te vinden is: het is ontworpen om elk model te kunnen draaien. Dus ja, jij kiest zelf per taak welk model je in Hermes stopt. En let op het onderscheid, hè: "Nous Hermes" zijn de taalmodellen, "Hermes Agent" is het harnas dat jij gebruikt. Twee verschillende producten van hetzelfde bedrijf.

Dan door naar Codex CLI. Dit harnas is van origine gebouwd rond de OpenAI-modellen, met name de GPT-codex-familie als standaard. Maar, goed nieuws, Codex is ook open source en kan andere, zelfs lokale, modellen draaien via een speciale vlag en wat configuratie. Denk aan Ollama, LM Studio of OpenRouter. Dit heb ik weliswaar gezien in guides en niet zelf uitgetest, dus behandel het als "waarschijnlijk waar." Een tester genaamd Prathit Joshi heeft in augustus 2026 zelfs een niet-OpenAI-model getest in zowel Codex als Claude Code en kreeg vergelijkbare resultaten. Zijn conclusie? Deze harnassen zijn geen dichtgetimmerde kokers die alleen met hun eigen model werken. Codex won bij hem trouwens net op betrouwbaarheid en delegeren; Claude was "beter op een goede dag, maar niet betrouwbaar op commando."

Dat brengt ons bij de bredere vergelijking en de vraag of een harnas nu echt afgestemd is op één model. Er zijn twee kanten aan het verhaal. Aan de ene kant zie je dat Claude Code aantoonbaar strak is verweven met Claude, en Codex heeft GPT-codex als standaard. Sommige bronnen suggereren zelfs dat Claude Code anders kan presteren met Claude, en Codex anders met een OpenAI-model. Maar aan de andere kant: de tests die écht hetzelfde model door meerdere harnassen haalden, vonden geen bewijs voor een harde lock-in. De ingebouwde gedragsinstructies, zoals het plannen en controleren van taken, blijken veel belangrijker te zijn dan het 'merk' van het model. Twee regels gedrag-prompting kunnen de prestatie flink beïnvloeden, zo bleek uit een onderzoek van Latch Bio. Kortom: niemand heeft hard bewezen dat een model slechter draait in het "verkeerde" harnas puur om het merk. De grote verschillen komen van hoe het harnas zelf is opgebouwd.

Wat betekent dit nu concreet voor jouw vloot, Jamal? Allereerst: kies je harnas net zo bewust als je model. Het kan zoals gezegd twintig punten verschil maken in succes! Met Hermes mag je vrijelijk experimenteren met elk model. Test per taak welk model het beste presteert; er is geen vaste 'beste'. Voor Codex is GPT-codex waarschijnlijk de beste keuze voor topwerk, maar als je goedkoop of lokaal wilt draaien, kan het wel, mits je het zelf goed test. En een belangrijk inzicht van ervaren bouwers: het is helemaal normaal en zelfs slim om twee harnassen naast elkaar te draaien. Bijvoorbeeld Claude Code voor architectuur en lange sessies, en Codex voor betrouwbaar afleveren en delegeren. Elk voor zijn eigen sterke punt.

Er zijn nog wel een paar onzekerheden. We hebben geen directe "beste model per harnas"-uitspraak gevonden voor Hermes specifiek, en de precieze configuratie voor lokale modellen in Codex heb ik alleen in handleidingen gezien en niet zelf geopend. En pas op, Jamal: dit onderwerp is een broedplaats voor SEO-spam en onbetrouwbare informatie. Ik heb me voor dit verslag alleen gericht op bronnen die ik echt heb gelezen en geanalyseerd.

Ik hoop dat deze inzichten je helpen bij het optimaliseren van je AI-vloot! Veel succes met het testen en het vinden van de perfecte combinatie. Tot de volgende keer!

titel: Welk agent-harnas werkt best met welk model?
datum: 2026-08-31

Welk agent-harnas werkt best met welk model?

Onderzoek voor Jamal naar wat andere mensen concludeerden na het testen van meerdere modellen. Focus: Hermes (jouw harnas), Codex, en de bredere vergelijking. Alleen bronnen die echt gelezen zijn.

De kern (als je maar 6 regels leest)

1. Hermes

Hermes Agent is een open-source agent-framework van Nous Research (MIT-licentie). Dezelfde kern draait als CLI, TUI, een native desktop-app, web-dashboard en op Telegram, Discord, Slack, WhatsApp en iMessage. Dat past precies bij jouw opzet.

Het is model-onafhankelijk. De site noemt toegang tot ruim 300 modellen en werkt met elke provider. Er staat nergens dat het op één model is afgestemd.

Eerlijk: er is geen goede publieke test gevonden van iemand die meerdere modellen ín Hermes vergeleek en een winnaar aanwees. Dat wordt nog nauwelijks openbaar besproken. Het framework is juist bedoeld om elk model te draaien.

Bron: https://hermes-agent.nousresearch.com/

2. Codex CLI (OpenAI)

Codex is duidelijk gebouwd op OpenAI-modellen (de GPT-codex-familie is de standaard).

Codex is open source en kan ook lokale of niet-OpenAI-modellen draaien via een oss-vlag en eigen providers in de config (bijvoorbeeld Ollama, LM Studio, OpenRouter). Let op: dit komt uit guides die de onderzoeker niet zelf opende, dus behandel het als waarschijnlijk waar, niet hard bewezen.

Een tester (Prathit Joshi, Composio, augustus 2026) draaide hetzelfde niet-OpenAI-model in zowel Codex als Claude Code en kreeg een gelijke score. Zijn conclusie: de harnassen zijn geen dichtgetimmerde koker voor hun eigen model. Codex won bij hem net op betrouwbaarheid en delegeren. Claude was "beter op een goede dag, maar niet betrouwbaar op commando".

Bron: https://composio.dev/content/claude-code-vs-openai-codex

3. De bredere vergelijking

Composio, "8 Best AI Agent Harnesses" (Sunil Kumar Dash, augustus 2026). Zij haalden één model door 8 harnassen. Zelfde model, wild verschillende resultaten: 68% tot 88% succes. Les: het harnas doet er enorm veel toe, los van het model.
Bron: https://composio.dev/content/best-ai-agent-harnesses

Latch Bio, "Why An Open Source Harness Outperforms Claude Code" (Joel Simonoff, juli 2026). Zij testten hetzelfde model in twee harnassen (een open-source harnas "Pi" tegen Claude Code). De winnaar wisselde per taak. Conclusie: de ingebouwde gedrag-instructies van het harnas verklaren het verschil, niet het model. Citaat: "twee regels gedrag-prompting kunnen de prestatie flink beïnvloeden".
Bron: https://blog.latch.bio/p/why-an-open-source-harness-outperforms

AIMultiple (Şevval Alper, augustus 2026). Draaide elke agent-CLI op hetzelfde model om puur het harnas te meten. Noemt Claude Code "strak geïntegreerd met de Claude-modelfamilie" en koploper op de SWE-bench-test.
Bron: https://aimultiple.com/agent-harness

4. Is een harnas afgestemd op één model?

Het bewijs wijst twee kanten op.

Vóór het idee: Claude Code is aantoonbaar strak verweven met Claude. Codex heeft GPT-codex als standaard. Composio zegt letterlijk dat Claude Code anders kan presteren met Claude, en Codex anders met een OpenAI-model.

Tegen een harde koppeling: de twee tests die écht hetzelfde model door meerdere harnassen haalden vonden geen bewijs dat een harnas alleen goed werkt met zijn eigen model. Het harnas-ontwerp verklaart meer dan het merk van het model.

Kort: niemand bewees hard dat een model slechter draait in het "verkeerde" harnas puur om het merk. De grote verschillen komen van hoe het harnas is opgebouwd.

Wat dit voor jouw vloot betekent

Onzeker of niet gevonden

🎙️ Bespreek met Jarvis