Hallo Jamal, welkom bij deze update over de ervaringen van Dani met Appel. We hebben de afgelopen tijd een grondige duik genomen in de gesprekken, met name de data tot en met 14 september, om te kijken hoe het systeem functioneert en waar we kunnen verbeteren.
Kortom, de analyse van Dani's interacties met Appel heeft een aantal terugkerende pijnpunten blootgelegd, vooral rondom het vasthouden van context, correcties en een natuurlijke gespreksstroom. Maar, en dat is belangrijk, we hebben ook gezien wat wél werkt en concrete stappen geformuleerd om deze problemen op te lossen. Het doel is duidelijk: een veel prettigere en effectievere leerervaring voor Dani creëren.
Laten we dieper ingaan op de bevindingen. We hebben een archief van de actieve server opgehaald, dat 6741 regels beslaat, maar dit is een gedeelde database. Het was een flinke klus om Dani's specifieke Appel-gesprekken hieruit te filteren; trefwoorden leverden wel 69 kandidaten op, maar we weten niet zeker of dit alles dekt. Belangrijk is dat de transcripties geen letterlijk audiobewijs zijn en we handmatig nog veel moeten controleren. Er is dus nog geen betrouwbaar foutpercentage vast te stellen.
Vervolgens kwamen we tot negen concrete, bewezen problemen. Het eerste is dat de **boekcontext** vaak ontbreekt of zelfs verzonnen wordt. Zo stelde de coach vragen over pagina 10 die er niet was, of verzon opgaven. De eis hier is helder: bronpagina en opdracht moeten eerst opgehaald worden, en als de bron ontbreekt, moet Appel expliciet stoppen met inhoudelijk gokken. Een inhoudsopgave is geen vervanging voor een echte boekpagina.
Ten tweede **onthoudt Appel correcties niet**. Bij Frans bleef het systeem woorden gebruiken die al eerder gecorrigeerd waren. De oplossing is een geselecteerde bronlijst voor alle vragen, met expliciete bronwissel en het intrekken van ongeldige vragen na correctie.
Een derde punt is **onjuiste goedkeuring**. Transcripts werden bevestigd terwijl ze onduidelijk waren, of de coach vulde zelf een antwoord in dat als 'juist' werd gelabeld. We eisen een exact gehoord antwoord, met herhaling of invulling bij onzekerheid, en absoluut geen goedkeuring op stilte of eigen aanvullingen.
Het **rekenpad ontspoort** regelmatig, als vierde probleem. Oorspronkelijke termen raakten kwijt, en er werden onnodig stappen gezet die het alleen maar complexer maakten. De oplossing is dat de oorspronkelijke som en Dani's stappen continu zichtbaar blijven, met een onafhankelijke algebra-check en het behandelen van de eerste afwijkende stap.
Verder **lopen uitleg en toetsing door elkaar heen**. Dani vraagt om uitleg, en krijgt dan een overhoring, of onbegrip wordt geduid als een verkeerde houding. Appel moet eerst een korte, concrete uitleg geven met één voorbeeld, en Dani dan laten toepassen. Geen vragen stellen over iets wat nog niet is uitgelegd.
Een zesde punt is de **onnodige gesprekslast**. Veel gereedheidsvragen, herhalingen en tegenvragen vertragen het proces. Dani heeft zelfs expliciet om een directer tempo gevraagd. We willen één kleine vraag per beurt en een normale voortgang, waarbij Dani zelf de controle houdt over pauzes en stops.
Ook wordt **begrip te snel aangenomen**. Na een simpele 'ja' of 'snap ik' gaat het gesprek verder. We hebben een eigen uitleg of toepassingsantwoord van Dani nodig als bewijs, en latere herhaling om te controleren of het echt is blijven hangen.
Het achtste probleem zit in de **spraak- en ondertitelingscontrole**. Ruis en onvolledige leerlingtekst bemoeilijken de analyse. Er moet een volledige, corrigeerbare leerlingtranscriptie zichtbaar zijn, zonder inhoudelijk oordeel bij onzekerheid.
En tot slot, de **logging mist beurtstatus**. Actuele logging kan tekst verliezen of afgebroken tekst verkeerd interpreteren bij onderbrekingen of verbinding verbrekingen. We hebben losse events en status nodig om dit betrouwbaar te maken voor toekomstige analyses.
Wat de bestaande oplossingen betreft: de Franse invultrainer en de OpenAI-wiskundeproef zijn apart en bewijzen niet dat de algemene spraakroute van Gemini is hersteld. Meer instructietekst alleen werkt niet; we hebben gezien dat dit al in de bron staat.
Dus, wat is de volgorde van uitvoeren? 1. Eerst de logging betrouwbaar maken. 2. Vervolgens de actuele opdracht als vaste broncontext met zichtbaar origineel en invoer. 3. Een duidelijke uitleg- en oefenmodus introduceren, zonder afkeurende reacties op onbegrip. 4. Later herhalen en toetsniveau aantonen. 5. Dezelfde probleemgevallen gebruiken voor regressietests, en daarna een echte proef met Dani. We meten dan specifiek bronafwijkingen, foutieve goedkeuringen, herhaalde correcties en hoeveel beurten het kost om bruikbare hulp te bieden.
Het goede nieuws is dat we al een technische proef hebben gedaan. De loggingfunctie is geïsoleerd getest, en we hebben reproduceerbare fouten (tekstverlies en aan elkaar geplakte antwoorden) kunnen herstellen. De lokale reparatie werkt; nu moet het alleen nog live geactiveerd worden.
En wat werkt wel en moeten we behouden? Korte, concrete voorbeelden leiden in meerdere gesprekken tot gerichtere antwoorden. Het gesprek over alinea's bevatte bijvoorbeeld een bruikbaar dagelijks voorbeeld. Ook het herkennen van geselecteerde paragrafen en gerichte hints zijn waardevol, mits de vraag uit de juiste bron komt en onbegrip niet wordt overgeslagen. De methode van Appel hoeft dus niet vervangen te worden; de uitvoering moet betrouwbaarder en eenvoudiger.
Dit was een uitgebreide blik op de uitdagingen en kansen. Het is duidelijk dat er veel te doen is, maar we hebben een helder pad vooruit. Bedankt voor je aandacht, Jamal, en laten we Appel samen naar een hoger niveau tillen voor Dani.
Archief opgehaald van de actieve VPS: conversations.jsonl, 6741 regels van 20 juni t/m 14 september 2026. Dit is een gedeeld Jarvis/Appel-archief, geen zuivere verzameling van Dani-gesprekken. 429 datum/sessiecombinaties inclusief systeemregels zonder sessie-ID. Trefwoordselectie levert 69 kandidaten; dit is geen bewijs dat alle 69 Appel zijn of dat er geen andere Appel-gesprekken zijn. Recente leergesprekken inhoudelijk gelezen; oudere kandidaten gericht onderzocht. Volledige handmatige afbakening blijft open. Geen betrouwbaar foutpercentage over alle gesprekken mogelijk. Transcripties zijn geen letterlijk audiobewijs.
De Franse vaste invultrainer en OpenAI-wiskundeproef zijn afzonderlijke verbeteringen. Ze bewijzen niet dat de algemene Gemini-spraakroute hersteld is. Er staan al instructies tegen onduidelijke goedkeuring in de actieve bron; nog meer instructietekst alleen is dus geen bewezen oplossing. Algemene leerstof, planning en meerdere coachingblokken worden tegelijk toegevoegd: overbelasting is een hypothese, geen gemeten causaliteit.
Ruwe gespreksbestanden blijven lokaal en worden niet openbaar gepubliceerd. Dit document bevat uitsluitend noodzakelijke productbevindingen.
De actuele loggingfunctie geïsoleerd getest zonder microfoon, schooldata te wijzigen of API-kosten te maken. Normale beurt slaagt; verbreking verliest tekst en onderbreking plakt antwoorden aan elkaar (twee reproduceerbare fouten). Lokale reparatie scheidt beide beurten, bewaart de laatste tekst en voegt bron/afrondingsstatus toe. Alle drie tests slagen en de volledige aangepaste bron compileert. Nog niet live geactiveerd; dus geen claim dat nieuwe gesprekken al volledig worden vastgelegd.
Korte concrete voorbeelden leiden in meerdere gesprekken tot een gerichter antwoord. Het gesprek over alinea's van 30 juli bevat een bruikbaar dagelijks voorbeeld. Op 3 juli herkende Appel de geselecteerde paragrafen en werd dat positief bevestigd. Gerichte hints en zelf antwoorden zijn waardevol, mits de vraag uit de juiste bron komt en onbegrip niet wordt overslagen. De methode hoeft dus niet vervangen; de uitvoering moet betrouwbaarder en eenvoudiger.
🎙️ Bespreek met Jarvis