
Wat Codex kan, hoe je ermee werkt en wat in jouw inrichting daadwerkelijk is getest.
Download de podcast · Download de verteltekst
Hoi, ik ben Soraya van Haarvisie. Wat leuk dat je naar onze podcast luistert. Vandaag ga ik je meer uitleggen over Codex. Wat kan het voor je doen? Hoe werken de verschillende onderdelen samen? En hoe gebruik jij het zonder dat je allerlei technische termen hoeft te onthouden? Deze aflevering is gebaseerd op de Codex-documentatie die voor jou is doorgenomen. Waar iets alleen beschreven staat, zeg ik dat. Want een functie die bestaat, is nog niet automatisch op jouw computer ingericht en getest.
Jamal, je gebruikt al verschillende vormen van kunstmatige intelligentie. Voor teksten, onderzoek, websites, de salon en andere projecten. Dan is een begrijpelijke vraag: wat voegt deze desktop-app eigenlijk toe? Codex kan naast antwoorden geven ook concrete werkzaamheden uitvoeren. Denk aan bestanden lezen, een document maken, code aanpassen of een resultaat controleren. Wat er werkelijk mogelijk is, hangt steeds af van de beschikbare gereedschappen en de toestemming die de app heeft. Je hoeft daarvoor niet zelf te kunnen programmeren. Wel helpt het om duidelijk te vertellen welk resultaat je wilt.
Stel dat je een overzicht wilt van een project. Je kunt zeggen: lees deze bestanden en vertel wat af is, wat nog ontbreekt en wat de eerstvolgende stap is. Dat is al veel gerichter dan alleen vragen om eens naar het project te kijken. Je kunt ook vragen om een document, een presentatie of een spreadsheet. Of om een fout op een website te onderzoeken. Het resultaat hoort vervolgens controleerbaar te zijn. Een bestand moet echt bestaan. Een aangepaste pagina moet bekeken zijn. En een berekening moet worden nagekeken. Alleen zeggen dat een opdracht is uitgevoerd, is onvoldoende.
In de app kom je projecten en taken tegen. Een project helpt om werk rond hetzelfde onderwerp bij elkaar te houden. Een taak is een apart gesprek waarin een bepaald resultaat centraal staat. Je kunt bijvoorbeeld één project voor een verbouwing hebben, met een taak voor de indeling en een andere voor de begroting. Die taken kunnen met dezelfde projectbestanden werken. Maar ze hebben niet automatisch hetzelfde gesprek in hun hoofd. Dat onderscheid is belangrijk. Als je in de ene taak een keuze maakt, hoeft een andere taak die keuze nog niet te kennen.
Daarom werkt een korte, duidelijke overdracht zo goed. Daarin staat wat het doel is, wat je hebt besloten, welke bestanden belangrijk zijn en wat er nog moet gebeuren. Zo kan een nieuwe taak verder op basis van iets dat echt is opgeslagen. Hetzelfde geldt wanneer je wisselt tussen Codex, Claude en Hermes. Dat zijn afzonderlijke omgevingen. Ze kunnen informatie uitwisselen via bestanden of een afgesproken gedeelde kennisbank. Dat gebeurt alleen als die route daadwerkelijk beschikbaar is en gebruikt wordt. Er is geen vanzelfsprekend gezamenlijk geheugen waarin ieder gesprek direct voor iedereen zichtbaar wordt.
Codex heeft daarnaast verschillende manieren om kennis en werkwijzen te bewaren. Projectinstructies leggen bijvoorbeeld vast hoe er gewerkt moet worden. Een skill bevat een herbruikbare aanpak voor een bepaald soort opdracht. Denk aan een podcastrecept, een controle voor een blog of een vaste manier om een rapport te maken. Geheugen kan helpen om eerdere informatie terug te vinden. Maar geheugen is selectief. Het is geen garantie dat ieder detail uit alle oude gesprekken altijd beschikbaar is. Bij een belangrijke afspraak blijft het verstandig om de bron erbij te halen.
Bij jouw inrichting is de bestaande kennisbank, gBrain, daadwerkelijk getest. De status kon worden opgehaald en een echte zoekopdracht leverde bestaande bronnen op. Dat is concreter bewijs dan alleen zien dat er een koppeling in een lijst staat. Tegelijk kan zo'n kennisbank oude informatie bevatten. Een gevonden afspraak moet dus worden beoordeeld op onderwerp en datum. Een stemkeuze voor lesaudio voor Dani hoeft bijvoorbeeld niet dezelfde te zijn als de stem voor een intern verslag voor jou. De toepassing bepaalt welke afspraak relevant is.
Een ander onderdeel is het samenwerken met meerdere agents. Je kunt een hoofdopdracht laten verdelen in afgebakende stukken. Bijvoorbeeld één agent die documentatie onderzoekt, en één die de bevindingen controleert. Daarna moeten de resultaten worden samengevoegd. Dat kan tijd besparen wanneer de onderdelen onafhankelijk van elkaar zijn. Maar meer agents is niet automatisch beter. Ze gebruiken extra capaciteit en ze moeten duidelijke opdrachten krijgen. Twee agents die tegelijk hetzelfde bestand veranderen, kunnen elkaar juist in de weg zitten. De hoofdtaak moet dus blijven controleren of de losse resultaten samen kloppen.
Soms wil je zelf rechtstreeks met een specialist verder praten. Dan past een aparte taak beter. Die taak blijft een eigen gesprek. Een coördinerende taak kan informatie opvragen of een vervolgopdracht sturen, maar moet dat ook echt doen. Alleen een mooie naam geven aan een agent verandert zijn vaardigheden of rechten niet. De bruikbare vraag is: welke bronnen krijgt deze agent, welk werk moet hij doen en hoe bewijst hij dat het gelukt is? Daarmee maak je samenwerking praktisch en overzichtelijk.
Je kunt met Codex ook praten, zoals je nu doet. Het spraakgesprek helpt om een opdracht uit te leggen, bij te sturen of een resultaat te bespreken. Het achterliggende taakmodel voert het werk uit. Dat onderscheid verklaart waarom je soms al kunt doorpraten terwijl een onderzoek nog loopt. Als je verwijst naar iets op je scherm, kan schermcontext helpen om vast te stellen wat je bedoelt. Dat is iets anders dan aannemen dat de app voortdurend alles ziet. Een schermopname, browsertoegang en activiteitengeschiedenis zijn verschillende functies met verschillende toegang.
Browserbediening is vooral nuttig wanneer informatie op een website moet worden bekeken of een online handeling moet worden gecontroleerd. Bijvoorbeeld zien of een knop werkt, of een formulier de juiste velden toont. Er zijn verschillende browserroutes en profielen. Een ingelogde sessie in de ene browser is daarom niet vanzelf beschikbaar in een andere omgeving. Voor jouw werk is dat extra belangrijk wanneer accounts van verschillende vestigingen apart moeten blijven. Een betrouwbare agent controleert dus welke omgeving hij gebruikt en of het resultaat echt zichtbaar is.
Een concreet voorbeeld uit het onderzoek is gStack. Dat is een verzameling werkwijzen en hulpmiddelen voor onder meer bouwen, beoordelen en testen. Op het moment van mijn controle was de browserbinary aanwezig en kon de hulptekst worden opgevraagd. Maar de echte browsertest liep vast omdat deze sessie geen lokale serverpoort mocht openen. Ook verwezen instructies naar een andere map dan waar de installatie stond. De juiste conclusie was daarom: aanwezig, maar nog niet volledig werkend bewezen. Dit was de gemeten toestand tijdens die controle. Een latere reparatie moet opnieuw met een echte handeling worden getest.
Voor terugkerend werk zijn er automatiseringen. Denk aan een ochtendoverzicht of een periodieke controle. Zo'n opdracht moet echt worden ingepland. Een gewone zin als: ik laat het later weten, maakt nog geen achtergrondtaak. Bij lokaal uitgevoerd werk moet de computer beschikbaar zijn wanneer het werk moet gebeuren. Ook moet duidelijk zijn wanneer je een melding krijgt. Voor een controle is het vaak prettiger om alleen bericht te krijgen wanneer er iets verandert of wanneer jouw aandacht nodig is. Anders krijg je vooral veel herhaling.
Codex kan volgens de documentatie ook op verschillende werkplekken worden gebruikt. De desktop-app helpt om taken, bestanden en resultaten overzichtelijk bij elkaar te houden. De terminalvariant past bij opdrachten en scripts. De versie in een programmeeromgeving kan aansluiten op het werk aan code. En er zijn mogelijkheden om werk op afstand uit te voeren. Welke daarvan jij kunt gebruiken, hangt af van je account, de beschikbare verbindingen en de inrichting. De documentatie beschrijft de mogelijkheden. Ze vormt geen bewijs dat al die routes nu al voor jou klaarstaan.
Bij plugins, skills en koppelingen is hetzelfde onderscheid nuttig. Een skill beschrijft vooral hoe een taak aangepakt kan worden. Een plugin kan verschillende onderdelen bundelen. Een koppeling geeft toegang tot een bepaalde dienst, binnen de rechten die ervoor gelden. Een lange lijst met namen is daarom geen goede eindcontrole. Een betere controle is een kleine, echte opdracht. Kan de kennisbank een bron vinden? Kan een document worden geopend? Kan de browser een pagina uitlezen? Pas zo zie je wat werkelijk bruikbaar is.
In deze documentatie- en skilltaak zijn vijf bestaande skills verbeterd. Eén blogskill is compleet gemaakt met de bijbehorende regels, referenties en controle. Bij vier andere skills is de beschrijving in de bestandskop hersteld. De blogcontrole is daarna getest met een voorbeeld met fouten en met een gecorrigeerd voorbeeld. De foute tekst werd afgekeurd en de verbeterde tekst kwam door de controle. Dat is nuttig bewijs voor precies die controle. Het bewijst nog niet dat ieder toekomstig artikel inhoudelijk perfect is, of dat Codex daarmee in alle opzichten beter werkt dan Claude.
Er zijn ook grenzen die juist duidelijk moeten blijven. Een agent kan best weten welke stap nodig is en toch niet de rechten hebben om die stap uit te voeren. Toegang tot lokale bestanden, een browser en een externe dienst zijn afzonderlijke dingen. Een foutmelding over toestemming betekent dus niet automatisch dat de installatie stuk is. Het is zaak eerst vast te stellen waar de handeling wordt tegengehouden. Daarna kan de passende oplossing worden gekozen. Jouw toestemming voor een opdracht maakt een technische beperking niet vanzelf ongedaan.
Ook het verbruik hangt af van hoe je werkt. Een moeilijke analyse met veel context en meerdere agents vraagt meer capaciteit dan een korte tekstbewerking. Er kunnen bovendien verschillende limieten gelden voor werk, spraak en externe diensten. Daarom is het verstandig om actuele gebruiksgegevens te bekijken en geen vaste aantallen uit een oud overzicht te beloven. Voor eenvoudig werk volstaat vaak een lichtere aanpak. Voor ingewikkelde beslissingen of een grondige controle kan meer denkwerk juist zinvol zijn. Het resultaat en de benodigde betrouwbaarheid horen de keuze te bepalen.
Wat betekent dit nu praktisch voor jou? Geef een taak een duidelijk resultaat, de juiste bronnen en een grens. Bijvoorbeeld: maak een begrijpelijk overzicht van deze documenten, controleer de feiten en verander nog niets aan de website. Of: verbeter deze tekst volgens de bestaande schrijfregels en laat zien welke punten je hebt aangepast. Vraag bij groter werk om een overdracht die bewaard blijft. En laat bij een technische verandering ook het bewijs zien. Daarmee hoef jij minder op losse beloftes te vertrouwen en kun je veel makkelijker beoordelen wat er werkelijk is gedaan.
Je hoeft dus niet alle knoppen, termen en instellingen te onthouden. Belangrijker is dat jouw opdrachten goed worden afgebakend, dat informatie terug te vinden is en dat resultaten worden gecontroleerd. De documentatie laat zien dat Codex veel onderdelen heeft waarmee dat kan. De inrichting en de tests bepalen hoeveel daarvan op jouw werkplek echt bruikbaar is. Dat onderscheid houden we ook in de verslagen aan. Dank je wel voor het luisteren, Jamal. Hopelijk is duidelijker geworden hoe je Codex kunt inzetten bij jouw projecten. Tot de volgende keer.