Haarvisie verslagen
← Alle verslagen📄 Download als PDF
🎧 Luister dit verslag
1,0x
⬇️ Download naar telefoon

AI Botschool voor bots — onderzoek & bouwplan

1. Kern in 5 zinnen

Het idee — een fysieke/digitale "school" waar mensen hun AI-bot naartoe brengen om per vak (instructie-volgen, tool-gebruik, geheugen, veiligheid, toon, domeinkennis) te laten trainen en toetsen — bestaat als concept nog nergens compleet, maar elk afzonderlijk onderdeel bestaat al wel los: eval-platforms zoals LangSmith en Braintrust leveren de "toetsen", RL/gym-omgevingen zoals WebArena, AgentBench en τ-bench leveren de "examenklassen", skill-marketplaces (Claude Skills, MCP Hubs) leveren het "lesmateriaal", en zelf-verbeterende frameworks (Hermes, Voyager, AutoGen-teachability) leveren het "leren zelf". Sierra en vergelijkbare consultancy-achtige diensten ("wij verbeteren je agent") bestaan al commercieel, maar zijn generiek en duur — geen aparte "klassen per vak". Veiligheid is het grootste onopgeloste probleem: prompt-injection-aanvallen op agents slagen in bestaande benchmarks nog in bijna de helft van de gevallen, en multi-tenant sandboxing tussen klanten-bots is technisch mogelijk (microVMs) maar niet plug-and-play. Voor Jamal is het meest realistische pad geen nieuw platform bouwen, maar een lichte eigen "schoolstructuur" (evals + curriculum + rapport) bovenop bestaande tools toepassen op de eigen vloot (Conductor, Sjakie, Coco, Paco) als eerste 4 leerlingen.


2. Bestaat dit al?

Naam URL Wat het doet Hoe dicht bij "breng je bot naar school"?
LangSmith https://www.langchain.com/langsmith Eval- en observability-platform voor LLM-apps: traces, datasets, evaluators, regressietests Toetsplatform, geen "lesprogramma". $39/seat, 10.000 traces inbegrepen (overage inmiddels $2,50–$5,00 per 1.000 extra traces — niet meer $0,50, zoals oudere bronnen vermelden).
Braintrust https://www.braintrust.dev Concurrent van LangSmith: evals, gratis tier, GitHub Action die een merge kan blokkeren bij regressie Zelfde niveau als LangSmith — toetsen, geen klassikaal curriculum. Let op: Braintrust noemt zelf Stripe, Vercel, Zapier, Airtable en Instacart als klanten op hun eigen vergelijkingspagina (braintrust.dev/articles/langsmith-vs-braintrust) — dit is niet onafhankelijk bevestigd en moet als marketingclaim behandeld worden, niet als feit.
WebArena https://webarena.dev Gestandaardiseerde "examen"-omgeving: 812 taken over 5 realistische websites (winkelen, forum, code-hosting e.d.) waarop agents worden getest Dit is letterlijk een "praktijkexamen-klas" voor webtaken — het dichtst bij één vak van de school (tool-gebruik/browsen). Geen leercurriculum, alleen toetsing.
AgentBench https://github.com/THUDM/AgentBench Multi-omgeving benchmark, ca. 1.091 taken over 8 omgevingen (OS, database, web-shopping, huishoud-simulatie e.d.) Vergelijkbaar met WebArena maar breder — meerdere "vakken" in één benchmark-suite. Exact taakaantal niet dubbel onafhankelijk geverifieerd, maar consistent met de gepubliceerde paper.
τ-bench (tau-bench) https://github.com/sierra-research/tau-bench Test agents op klantenservice-achtige taken met een drievoudig succescriterium (taak voltooid + juiste tool-calls + eindstatus correct) Meest "school-achtig" qua toetslogica: één taak wordt op 3 aparte criteria beoordeeld, zoals een rubric. Gebouwd door Sierra zelf.
Claude Skills / MCP-hubs https://www.anthropic.com/news/skills · https://github.com/modelcontextprotocol Marktplaats-achtige structuur voor herbruikbare "vaardigheden" (skills) en tools die een agent kan laden Dit is het "lesmateriaal/tekstboek"-onderdeel — geen training, wel het curriculum-materiaal an sich.
Hermes Agent (skill_manage / self-evolving skills) secundaire bron: the-agent-report.com (open-source release, niet Nous Research zelf) Agent evolueert zijn eigen skills via "Read, Mutate, Evaluate, Select"; skills ≤15KB, tool-beschrijvingen ≤500 tekens; kosten $2–10 per optimalisatie-run; alle wijzigingen door mens gereviewd vóór toepassing Dichtst bij een "bot die zichzelf bijschoolt", maar dit is een self-reported ontwerpbelofte van een open-source project, geen onafhankelijk geauditeerde praktijk.
Voyager (Minecraft-agent) https://voyager.minedojo.org Bouwt een groeiende "skill-bibliotheek" (code als vaardigheid), 3,3x/2,3x/15,3x sneller item-ontdekking dan baselines, generaliseert naar nieuwe werelden Academisch bewijs dat een curriculum + skill-bibliotheek écht werkt voor een agent — conceptueel de sterkste onderbouwing voor "klassen per vak", al is het domein specifiek (game-wereld).
AutoGen teachability Microsoft AutoGen docs/blog Agent onthoudt losse "memo's" die later worden opgehaald i.p.v. alles in de context te proppen; op een specifiek wiskundeprobleem steeg slagingspercentage van 32% naar >95% na één aangeleerde strategie Sterk voorbeeld van "een les geven en die blijft hangen" — maar dit is een puntvoorbeeld/showcase uit één probleemtype, geen brede benchmark. Niet generaliseren naar "AutoGen-teaching verdriedubbelt altijd je score".
AgentDojo academisch paper (arxiv) Benchmark met 97 taken en 629 prompt-injection-aanvalsscenario's om agent-robuustheid te meten Dit is het "veiligheidsexamen" van de school — cruciaal onderdeel, bestaat al als standaard.
Sierra ("wij verbeteren je agent"-achtige dienst) https://sierra.ai Commerciële partij die klantenservice-AI-agents bouwt en verkoopt op basis van resultaat (afrekenen per opgeloste conversatie, upsell/cross-sell, of afgehandelde vraag/L2-call) Dichtst bij een "professionele bijschoolcoach" die een bedrijf inhuurt — maar dit is end-to-end bouwen/beheren, geen apart in te leveren les-en-toets-traject voor een bot die je zelf al hebt. Cijfers over Sierra's eigen prijsmodel zijn Sierra's eigen marketingclaim, niet onafhankelijk bevestigd.
Fin (fin.ai) prijsschattingen van Sierra https://fin.ai Concurrent van Sierra die schat wat Sierra's (niet-publieke) tarieven zouden zijn Let op: dit is een concurrent die zichzelf goedkoper positioneert — behandel als schatting, niet als bevestigd Sierra-cijfer. Break-even-cijfer "250.000 gesprekken/maand" kon niet worden teruggevonden op de pagina; wel een ander vergelijkingspunt (50.000 gesprekken/maand, ca. $594k/jaar bij Fin).
Layer3Labs (agent-consultancy pricing) layer3labs-achtige consultancy-pagina Strategie $5k–$50k, implementatie $15k–$150k, retainer $2k–$15k/maand Cijfers in eerdere versies van dit onderzoek waren te laag — dit zijn de gecorrigeerde bedragen. Het genoemde case-study-bedrag van $18.500 is expliciet een "Worked Example" (illustratief rekenvoorbeeld) volgens de bron zelf — géén gedocumenteerde, geverifieerde klantcasus. Niet als hard bewijs gebruiken.

Conclusie deel 1: geen enkel bestaand platform combineert (a) een curriculum per vak, (b) sandbox-per-klas, (c) voor/na-toetsing, en (d) een diploma/rapport in één samenhangend product gericht op "breng je eigen bot". De bouwstenen bestaan allemaal apart en zijn volwassen genoeg om te hergebruiken.


3. Technisch bouwplan

3.1 Vakken/klassen (voorstel)

Vak/klas Wat wordt getest Voorbeeldbenchmark/methode
Instructie-volgen Volgt de bot exact wat er gevraagd wordt, ook bij tegenstrijdige of impliciete instructies? Eigen eval-set + LLM-judge (zie 3.3)
Tool-gebruik Kiest de bot het juiste tool/de juiste API-call, in de juiste volgorde? WebArena-achtige taken, τ-bench-stijl 3-voudig criterium
Geheugen Onthoudt de bot relevante context over meerdere sessies, zonder alles opnieuw in de prompt te hoeven zetten? AutoGen-teachability-patroon: memo's opslaan/ophalen, voor/na-vergelijking van taakscore
Veiligheid Weerstaat de bot prompt-injection, data-exfiltratie-pogingen, jailbreaks? AgentDojo-achtige aanvalsscenario's (97 taken/629 aanvallen als ijkpunt)
Toon/stijl Blijft de bot consistent in merk-stem, taalgebruik, format (bv. Nederlands/dyslexie-vriendelijk voor Haarvisie-bots)? LLM-judge met rubric per merk
Domeinkennis Beheerst de bot specifieke vakkennis (bv. kapsalon-tarieven, kleurtechnieken, WordPress-workflows)? Eigen Q&A-testset + retrieval-check

3.2 Wat is een "les" concreet?

Een les = een klein, herhaalbaar pakket van drie onderdelen:
1. Materiaal — een skill/prompt-toevoeging/tool-definitie (vergelijkbaar met een Claude Skill of MCP-tool).
2. Oefening — een reeks synthetische taken die de bot moet uitvoeren in een sandbox (net als WebArena/AgentBench-taken).
3. Feedback-lus — een score + concrete correctie, die wordt teruggevoerd in het skill-bestand (zoals Hermes' "Read, Mutate, Evaluate, Select"-cyclus).

3.3 Hoe werkt een toets?

Drie complementaire methodes, te combineren:
- Evals/benchmarks — vaste taakset met objectief meetbare uitkomst (bereikt de bot het doel: ja/nee, hoeveel stappen, welke tools).
- LLM-judge — een tweede (sterker) model beoordeelt kwalitatieve aspecten (toon, volledigheid, veiligheid) aan de hand van een rubric — zoals LangSmith/Braintrust dit inzetten.
- Regressietest — elke nieuwe les mag de score op eerdere lessen niet verlagen (Braintrust's aanpak: GitHub Action blokkeert een merge bij regressie).

3.4 Diploma/rapport

Een simpel scorekaartje per vak (0-100%) + een totaalcijfer, met:
- Voor/na-vergelijking per vak (delta in score).
- Concrete voorbeelden van fouten die zijn opgelost.
- Een "zwakke plekken"-sectie voor vervolglessen.
Dit hoeft geen zwaar systeem te zijn — een los HTML/markdown-rapport per bot, per trainingsronde, is voldoende voor een MVP.

3.5 Architectuur


4. Veiligheid

Dit is het meest risicovolle onderdeel als je "andermans bot" gaat trainen — niet alleen je eigen vloot.

Praktisch advies voor Jamal: begin met sandboxing per klas + git-versiebeheer + mens-review, en behandel élke door een klant aangeleverde bot-configuratie als onvertrouwde input totdat die door de veiligheidsklas is gelopen. Voor de eigen vloot (Conductor/Sjakie/Coco/Paco) is het risico lager omdat alles al "binnen het huis" draait (bestaande regel), maar de eval/sandbox-discipline is ook daar nuttig.


5. Markt + concreet MVP-voorstel

Wie zou dit kopen?

Realistisch MVP voor Jamals eigen vloot

Gebruik de eigen bots als eerste "leerlingen" — geen nieuw platform bouwen, wel de schoolstructuur toepassen:

  1. Stap 1 — Intake-toets (1 dag): kies 2-3 vakken die het meest opleveren voor de vloot: tool-gebruik (gebruiken Conductor/Sjakie/Coco/Paco de juiste scripts/queue-commando's?), veiligheid (reageren ze correct op een geïnjecteerde/foute instructie in de Supabase-queue?), toon/stijl (houden ze zich aan de dyslexie-vriendelijke schrijfstijl en het "geen ruis"-principe?).
  2. Stap 2 — Bouw een kleine taakset per vak (10-20 taken per vak, geen honderden) — bijvoorbeeld: "verwerk deze binnenkomende Telegram-taak correct", "herken deze prompt-injectie in een queue-bericht en weiger", "beantwoord in dyslexie-stijl".
  3. Stap 3 — Voor-meting: laat elke bot (Conductor, Sjakie, Coco, Paco) de taakset nu draaien, score het resultaat (zelf beoordelen of met een LLM-judge/rubric).
  4. Stap 4 — Eén les per zwak vak: pas één skill/instructie aan (bijvoorbeeld een extra regel in de skill-bestanden), via git-versiebeheer, mens-review vóór toepassing.
  5. Stap 5 — Na-meting + rapport: dezelfde taakset opnieuw draaien, score vergelijken, klein rapport per bot maken (net als het diploma-idee uit 3.4).
  6. Stap 6 — Herhaal maandelijks als vast ritueel, in lijn met bestaande gewoontes (milestone-logging, Slack-log bij besluiten).

Dit MVP kost vrijwel niets (geen nieuw platform, geen dure GPU-training — vergelijkbaar met Hermes' schatting van $2-10 per optimalisatieronde), levert meetbare verbetering op, en is de basis waarmee je later — als het goed werkt op de eigen vloot — kan beoordelen of een breder "breng je bot naar school"-product voor andere kapsalons of klanten levensvatbaar is.

Wat nog niet bestaat/niet vindbaar is

🎙️ Bespreek met Jarvis