Hoi Jamal, welkom bij deze update! Vandaag duiken we in de belangrijkste punten van een recente vergadering, waarin we kritisch hebben gekeken naar de staat van onze AI-modellen en de systemen eromheen. Er waren best wat uitdagingen, maar gelukkig ook concrete plannen om vooruit te komen. Luister maar mee, want dit raakt ons allemaal.
Laten we beginnen met een zorgwekkende trend: sinds 5 augustus presteren diverse AI-modellen aantoonbaar slechter. Ze maken meer fouten en lijken minder slim dan voorheen. Dit is niet alleen een intern probleem; er zijn online breed gedeelde klachten over deze ‘downgrade’, en we zien dit ook terug in onze eigen systemen. De prestatie-achteruitgang is merkbaar.
Een belangrijke oorzaak hiervan lijkt in de architectuur te zitten. Ons huidige systeem werd vergeleken met een boot die instabiel is geworden door te veel toevoegingen aan één kant. Simpel gezegd: er zijn te veel ‘sources of truth’, te veel plekken waar informatie vandaan komt, wat leidt tot herhaling en fouten. Er is besloten om te herzien naar één centrale bron van waarheid per klant, met een specifiek playbook zodat de AI precies weet waar de benodigde informatie te vinden is. Dit moet de stabiliteit en nauwkeurigheid ten goede komen.
Over bots gesproken, er werd gesproken over het gebruik van een ‘Hermes bot’ via het Codex-model, die toegang heeft tot alle mappen en via Telegram communiceert. Het plan is ook om een ‘Kimmie’ terminalbot te bouwen voor klanttesten. Echter, de communicatie via Telegram voor de Hermes bot roept vragen op, omdat het veel tokens verbruikt en ineffectief is voor het terughalen van context. Dit brengt ons bij een ander groot probleem: het hoge tokenverbruik. We verbruiken soms tot wel 400 miljoen tokens per dag, doordat bij elke simpele vraag de volledige context opnieuw wordt meegestuurd. De voorgestelde oplossing hiervoor is om sessies op te splitsen per taak.
Een ander aandachtspunt is de proactiviteit van onze AI. Ons model, Linky, zou meer zelfstandig analyses moeten uitvoeren en taken moeten initiëren, in plaats van passief te wachten op instructies. Momenteel genereert de AI wel taakopsommingen, maar moet er handmatig akkoord gegeven worden. Het voorstel is om een prompt te ontwikkelen die de AI toestemming geeft om bepaalde acties uit verslagen automatisch uit te voeren. Dit zou een grote stap zijn richting verdere automatisering.
Veiligheid is altijd prioriteit. Er is een terugkerend probleem met API-keys die openbaar zijn geworden, wat dagelijks leidt tot beveiligingsmeldingen. Hoewel er al een alert is ingesteld die direct waarschuwt bij verdachte activiteiten en handmatige bevestiging vraagt, is automatische key-rotatie cruciaal en nog niet geïmplementeerd. Dit moet snel opgepakt worden.
Goed nieuws voor beginners: er wordt gewerkt aan een AI-cursus, speciaal voor ‘rookies’. Deze cursus moet de leercurve vereenvoudigen die we zelf hebben doorlopen, en dekt onder meer werken met de terminal. De verwachte prijsrange ligt tussen de 500 en 900 euro.
Natuurlijk zijn er ook concrete afspraken gemaakt. Er zal een terminalbot met Kimmie gebouwd en getest worden voor klantgebruik. Het AI-systeem moet zichzelf analyseren als een senior developer om de architectuur te verbeteren. Een nieuw dashboard, passend bij de huidige werkzaamheden, zal worden herontworpen. En om dat tokenverbruik te verlagen, gaan we taakgebaseerde sessies definiëren en implementeren. Daarnaast werken we aan een prompt- en toestemmingsframework voor automatische uitvoering van acties en staat automatische rotatie van API-keys en de bijbehorende monitoring op de agenda.
Tot slot, de AI zelf heeft ook een paar punten geïdentificeerd waar nog geen concrete actie op is genomen. Denk aan dat hoge tokenverbruik: de oplossing om sessies op te splitsen is voorgesteld, maar nog niet omgezet in een concreet actiepunt. Ook de proactiviteit van de AI, en het automatische roteren van API-keys – hoewel als belangrijk genoemd – wachten nog op een duidelijk implementatieplan.
Dat waren de highlights, Jamal. Zoals je hoort, genoeg te doen en belangrijke stappen om onze AI-systemen robuuster, efficiënter en veiliger te maken. Laten we hier samen mee aan de slag gaan! Tot de volgende keer.
Soort: vergadering · Duur: onbekend · Deelnemers: [Spreker 1] [Spreker 2]
Let op — sprekers niet bevestigd. Plaud nummert sprekers (Speaker 1, 2, …) maar koppelt geen namen. Ga niet uit van wie wat zei; "ik/wij" hoeft niet dezelfde persoon te zijn.
Notulen
Degradatie van AI-modellen
Sinds 5 augustus presteren bepaalde AI-modellen aantoonbaar slechter en maken ze meer domme fouten dan voorheen.
Spreker 1 wijst op brede online klachten over deze “downgrade”.
Spreker 2 bevestigt vergelijkbare problemen: zijn model vertoont sinds 5 augustus prestatieachteruitgang.
Architectuur en ‘source of truth’
Spreker 2 vergelijkt zijn systeemarchitectuur met een boot die door voortdurende toevoegingen aan één kant te zwaar wordt, wat instabiliteit veroorzaakt.
Conclusie: er zijn te veel “sources of truth”, wat herhaling en fouten in de hand werkt.
Spreker 1 heeft zijn systeem herzien naar één centrale “source of truth”; elke klant krijgt een eigen playbook zodat de AI exact weet waar informatie te vinden is.
Gebruik en testen van verschillende bots en modellen
Spreker 1 draait een “Hermes bot” op zijn Mac via het Codex-model met toegang tot alle mappen.
Hij plant een terminalbot met “Kimmie” te bouwen voor klanttesten.
Communicatie met de Hermes bot verloopt via Telegram; volgens Spreker 2 verbruikt dit veel tokens en is het ineffectief voor contextteruglezing.
Hoog tokenverbruik (tot 400 miljoen per dag) ontstaat doordat bij simpele vragen steeds de volledige context wordt meegestuurd. Voorgestelde oplossing: sessies opsplitsen per taak.
Proactiviteit en automatisering van AI
Spreker 2 vindt zijn AI-model (Linky) onvoldoende proactief; het zou zelfstandig analyses moeten uitvoeren en taken initiëren.
Het model van Spreker 1 genereert wel taakopsommingen, waarna hij handmatig akkoord geeft.
Voorgestelde oplossing: een prompt ontwikkelen die de AI toestemming geeft om bepaalde acties uit verslagen automatisch uit te voeren.
Veiligheid en beheer van API-keys
Er is een terugkerend probleem met openbaar geworden API-keys, wat dagelijks tot beveiligingsmeldingen leidt.
Spreker 1 heeft een alert ingesteld die direct waarschuwt bij verdachte activiteiten; hij moet vervolgens bevestigen of hij de actie zelf heeft uitgevoerd.
Automatische key-rotatie wordt als belangrijk gezien, maar is nog niet geïmplementeerd.
Ontwikkeling van een AI-cursus
Spreker 2 ontwikkelt een AI-cursus voor beginners (“rookies”).
De cursus dekt onder meer werken met de terminal en moet de leercurve die zij zelf doorliepen voor anderen vereenvoudigen.
Suggestie: prijsrange €500–€900.
Volgende afspraken
Spreker 1: bouw en test een terminalbot met Kimmie voor klantgebruik.
Spreker 2: laat het AI-systeem zichzelf analyseren alsof het een senior developer is, en verbeter op basis daarvan de architectuur/structuur.
Spreker 1: herontwerp een nieuw dashboard dat aansluit bij de huidige werkzaamheden.
Beiden: definieer en implementeer taakgebaseerde sessies om tokenverbruik te verlagen (opsplitsen per taak).
Beiden: ontwerp een prompt- en toestemmingsframework voor automatische uitvoering van geselecteerde acties.
Beiden: plan en implementeer automatische rotatie van API-keys en bijbehorende monitoring.
AI-suggesties
AI-suggesties
AI heeft de volgende problemen geïdentificeerd die niet zijn afgesloten in de vergadering of waarvoor duidelijke actiepunten ontbreken; gelieve hierop te letten:
Er is een significant hoog tokenverbruik (tot 400 miljoen per dag) vastgesteld, wat leidt tot hoge kosten. De voorgestelde oplossing om sessies op te splitsen per taak is nog niet in een concreet actiepunt omgezet.
De AI-modellen zijn niet proactief genoeg. Er is besproken dat de AI zelfstandig taken zou moeten uitvoeren, maar er is geen duidelijk plan om dit te implementeren, behalve het idee om een prompt te maken.
Er is een terugkerend beveiligingsrisico met openbare API-keys. Het automatisch roteren van keys werd als belangrijk genoemd, maar er is geen besluit genomen om dit te implementeren.
🎙️ Bespreek met Jarvis