Het idee — een fysieke/digitale "school" waar mensen hun AI-bot naartoe brengen om per vak (instructie-volgen, tool-gebruik, geheugen, veiligheid, toon, domeinkennis) te laten trainen en toetsen — bestaat als concept nog nergens compleet, maar elk afzonderlijk onderdeel bestaat al wel los: eval-platforms zoals LangSmith en Braintrust leveren de "toetsen", RL/gym-omgevingen zoals WebArena, AgentBench en τ-bench leveren de "examenklassen", skill-marketplaces (Claude Skills, MCP Hubs) leveren het "lesmateriaal", en zelf-verbeterende frameworks (Hermes, Voyager, AutoGen-teachability) leveren het "leren zelf". Sierra en vergelijkbare consultancy-achtige diensten ("wij verbeteren je agent") bestaan al commercieel, maar zijn generiek en duur — geen aparte "klassen per vak". Veiligheid is het grootste onopgeloste probleem: prompt-injection-aanvallen op agents slagen in bestaande benchmarks nog in bijna de helft van de gevallen, en multi-tenant sandboxing tussen klanten-bots is technisch mogelijk (microVMs) maar niet plug-and-play. Voor Jamal is het meest realistische pad geen nieuw platform bouwen, maar een lichte eigen "schoolstructuur" (evals + curriculum + rapport) bovenop bestaande tools toepassen op de eigen vloot (Conductor, Sjakie, Coco, Paco) als eerste 4 leerlingen.
| Naam | URL | Wat het doet | Hoe dicht bij "breng je bot naar school"? |
|---|---|---|---|
| LangSmith | https://www.langchain.com/langsmith | Eval- en observability-platform voor LLM-apps: traces, datasets, evaluators, regressietests | Toetsplatform, geen "lesprogramma". $39/seat, 10.000 traces inbegrepen (overage inmiddels $2,50–$5,00 per 1.000 extra traces — niet meer $0,50, zoals oudere bronnen vermelden). |
| Braintrust | https://www.braintrust.dev | Concurrent van LangSmith: evals, gratis tier, GitHub Action die een merge kan blokkeren bij regressie | Zelfde niveau als LangSmith — toetsen, geen klassikaal curriculum. Let op: Braintrust noemt zelf Stripe, Vercel, Zapier, Airtable en Instacart als klanten op hun eigen vergelijkingspagina (braintrust.dev/articles/langsmith-vs-braintrust) — dit is niet onafhankelijk bevestigd en moet als marketingclaim behandeld worden, niet als feit. |
| WebArena | https://webarena.dev | Gestandaardiseerde "examen"-omgeving: 812 taken over 5 realistische websites (winkelen, forum, code-hosting e.d.) waarop agents worden getest | Dit is letterlijk een "praktijkexamen-klas" voor webtaken — het dichtst bij één vak van de school (tool-gebruik/browsen). Geen leercurriculum, alleen toetsing. |
| AgentBench | https://github.com/THUDM/AgentBench | Multi-omgeving benchmark, ca. 1.091 taken over 8 omgevingen (OS, database, web-shopping, huishoud-simulatie e.d.) | Vergelijkbaar met WebArena maar breder — meerdere "vakken" in één benchmark-suite. Exact taakaantal niet dubbel onafhankelijk geverifieerd, maar consistent met de gepubliceerde paper. |
| τ-bench (tau-bench) | https://github.com/sierra-research/tau-bench | Test agents op klantenservice-achtige taken met een drievoudig succescriterium (taak voltooid + juiste tool-calls + eindstatus correct) | Meest "school-achtig" qua toetslogica: één taak wordt op 3 aparte criteria beoordeeld, zoals een rubric. Gebouwd door Sierra zelf. |
| Claude Skills / MCP-hubs | https://www.anthropic.com/news/skills · https://github.com/modelcontextprotocol | Marktplaats-achtige structuur voor herbruikbare "vaardigheden" (skills) en tools die een agent kan laden | Dit is het "lesmateriaal/tekstboek"-onderdeel — geen training, wel het curriculum-materiaal an sich. |
| Hermes Agent (skill_manage / self-evolving skills) | secundaire bron: the-agent-report.com (open-source release, niet Nous Research zelf) | Agent evolueert zijn eigen skills via "Read, Mutate, Evaluate, Select"; skills ≤15KB, tool-beschrijvingen ≤500 tekens; kosten $2–10 per optimalisatie-run; alle wijzigingen door mens gereviewd vóór toepassing | Dichtst bij een "bot die zichzelf bijschoolt", maar dit is een self-reported ontwerpbelofte van een open-source project, geen onafhankelijk geauditeerde praktijk. |
| Voyager (Minecraft-agent) | https://voyager.minedojo.org | Bouwt een groeiende "skill-bibliotheek" (code als vaardigheid), 3,3x/2,3x/15,3x sneller item-ontdekking dan baselines, generaliseert naar nieuwe werelden | Academisch bewijs dat een curriculum + skill-bibliotheek écht werkt voor een agent — conceptueel de sterkste onderbouwing voor "klassen per vak", al is het domein specifiek (game-wereld). |
| AutoGen teachability | Microsoft AutoGen docs/blog | Agent onthoudt losse "memo's" die later worden opgehaald i.p.v. alles in de context te proppen; op een specifiek wiskundeprobleem steeg slagingspercentage van 32% naar >95% na één aangeleerde strategie | Sterk voorbeeld van "een les geven en die blijft hangen" — maar dit is een puntvoorbeeld/showcase uit één probleemtype, geen brede benchmark. Niet generaliseren naar "AutoGen-teaching verdriedubbelt altijd je score". |
| AgentDojo | academisch paper (arxiv) | Benchmark met 97 taken en 629 prompt-injection-aanvalsscenario's om agent-robuustheid te meten | Dit is het "veiligheidsexamen" van de school — cruciaal onderdeel, bestaat al als standaard. |
| Sierra ("wij verbeteren je agent"-achtige dienst) | https://sierra.ai | Commerciële partij die klantenservice-AI-agents bouwt en verkoopt op basis van resultaat (afrekenen per opgeloste conversatie, upsell/cross-sell, of afgehandelde vraag/L2-call) | Dichtst bij een "professionele bijschoolcoach" die een bedrijf inhuurt — maar dit is end-to-end bouwen/beheren, geen apart in te leveren les-en-toets-traject voor een bot die je zelf al hebt. Cijfers over Sierra's eigen prijsmodel zijn Sierra's eigen marketingclaim, niet onafhankelijk bevestigd. |
| Fin (fin.ai) prijsschattingen van Sierra | https://fin.ai | Concurrent van Sierra die schat wat Sierra's (niet-publieke) tarieven zouden zijn | Let op: dit is een concurrent die zichzelf goedkoper positioneert — behandel als schatting, niet als bevestigd Sierra-cijfer. Break-even-cijfer "250.000 gesprekken/maand" kon niet worden teruggevonden op de pagina; wel een ander vergelijkingspunt (50.000 gesprekken/maand, ca. $594k/jaar bij Fin). |
| Layer3Labs (agent-consultancy pricing) | layer3labs-achtige consultancy-pagina | Strategie $5k–$50k, implementatie $15k–$150k, retainer $2k–$15k/maand | Cijfers in eerdere versies van dit onderzoek waren te laag — dit zijn de gecorrigeerde bedragen. Het genoemde case-study-bedrag van $18.500 is expliciet een "Worked Example" (illustratief rekenvoorbeeld) volgens de bron zelf — géén gedocumenteerde, geverifieerde klantcasus. Niet als hard bewijs gebruiken. |
Conclusie deel 1: geen enkel bestaand platform combineert (a) een curriculum per vak, (b) sandbox-per-klas, (c) voor/na-toetsing, en (d) een diploma/rapport in één samenhangend product gericht op "breng je eigen bot". De bouwstenen bestaan allemaal apart en zijn volwassen genoeg om te hergebruiken.
| Vak/klas | Wat wordt getest | Voorbeeldbenchmark/methode |
|---|---|---|
| Instructie-volgen | Volgt de bot exact wat er gevraagd wordt, ook bij tegenstrijdige of impliciete instructies? | Eigen eval-set + LLM-judge (zie 3.3) |
| Tool-gebruik | Kiest de bot het juiste tool/de juiste API-call, in de juiste volgorde? | WebArena-achtige taken, τ-bench-stijl 3-voudig criterium |
| Geheugen | Onthoudt de bot relevante context over meerdere sessies, zonder alles opnieuw in de prompt te hoeven zetten? | AutoGen-teachability-patroon: memo's opslaan/ophalen, voor/na-vergelijking van taakscore |
| Veiligheid | Weerstaat de bot prompt-injection, data-exfiltratie-pogingen, jailbreaks? | AgentDojo-achtige aanvalsscenario's (97 taken/629 aanvallen als ijkpunt) |
| Toon/stijl | Blijft de bot consistent in merk-stem, taalgebruik, format (bv. Nederlands/dyslexie-vriendelijk voor Haarvisie-bots)? | LLM-judge met rubric per merk |
| Domeinkennis | Beheerst de bot specifieke vakkennis (bv. kapsalon-tarieven, kleurtechnieken, WordPress-workflows)? | Eigen Q&A-testset + retrieval-check |
Een les = een klein, herhaalbaar pakket van drie onderdelen:
1. Materiaal — een skill/prompt-toevoeging/tool-definitie (vergelijkbaar met een Claude Skill of MCP-tool).
2. Oefening — een reeks synthetische taken die de bot moet uitvoeren in een sandbox (net als WebArena/AgentBench-taken).
3. Feedback-lus — een score + concrete correctie, die wordt teruggevoerd in het skill-bestand (zoals Hermes' "Read, Mutate, Evaluate, Select"-cyclus).
Drie complementaire methodes, te combineren:
- Evals/benchmarks — vaste taakset met objectief meetbare uitkomst (bereikt de bot het doel: ja/nee, hoeveel stappen, welke tools).
- LLM-judge — een tweede (sterker) model beoordeelt kwalitatieve aspecten (toon, volledigheid, veiligheid) aan de hand van een rubric — zoals LangSmith/Braintrust dit inzetten.
- Regressietest — elke nieuwe les mag de score op eerdere lessen niet verlagen (Braintrust's aanpak: GitHub Action blokkeert een merge bij regressie).
Een simpel scorekaartje per vak (0-100%) + een totaalcijfer, met:
- Voor/na-vergelijking per vak (delta in score).
- Concrete voorbeelden van fouten die zijn opgelost.
- Een "zwakke plekken"-sectie voor vervolglessen.
Dit hoeft geen zwaar systeem te zijn — een los HTML/markdown-rapport per bot, per trainingsronde, is voldoende voor een MVP.
Dit is het meest risicovolle onderdeel als je "andermans bot" gaat trainen — niet alleen je eigen vloot.
Praktisch advies voor Jamal: begin met sandboxing per klas + git-versiebeheer + mens-review, en behandel élke door een klant aangeleverde bot-configuratie als onvertrouwde input totdat die door de veiligheidsklas is gelopen. Voor de eigen vloot (Conductor/Sjakie/Coco/Paco) is het risico lager omdat alles al "binnen het huis" draait (bestaande regel), maar de eval/sandbox-discipline is ook daar nuttig.
Gebruik de eigen bots als eerste "leerlingen" — geen nieuw platform bouwen, wel de schoolstructuur toepassen:
Dit MVP kost vrijwel niets (geen nieuw platform, geen dure GPU-training — vergelijkbaar met Hermes' schatting van $2-10 per optimalisatieronde), levert meetbare verbetering op, en is de basis waarmee je later — als het goed werkt op de eigen vloot — kan beoordelen of een breder "breng je bot naar school"-product voor andere kapsalons of klanten levensvatbaar is.