Hé Jamal, even luisteren! Ik heb het gesprek met Mike over die AI-doorvliegvideo’s uitgewerkt en er een concreet advies uit gehaald. Er zit veel potentieel in, maar vooral duidelijkheid over wat wel en niet realistisch is op korte termijn.
De kern is dit: Mike maakt die gave 'fly-through' video's van huizen of hotels niet met één AI-knop, maar met een slimme 3D-keten. Denk Blender om het gebouw te boetseren, dan Unreal Engine om de camera erdoorheen te laten vliegen, licht en schaduw toe te voegen en de film te renderen. En *daarbovenop* zet hij dan pas een AI-videomodel – waarschijnlijk Veo 3.1 – om het allemaal nog fotorealistischer en mooier te maken. Hij vertelde zelf ook eerlijk dat het even zoeken is; hij heeft geen kant-en-klare stappenplan.
Jij zag hier natuurlijk meteen kansen voor twee dingen: die winkelcentrum-visualisatie voor Eric van Easy Technical Solutions, en voor "onze eigen dingen". Daarnaast kwam het idee van een 3D-avatar die op jou lijkt en met je praat, vooral voor Dani en de Apple-app, en die grote wens: de spraakstand van ChatGPT integreren in Claude of Hermes. Mike's antwoord hierop klopt half: het is meer dan alleen Whisper, dat is alleen de luisterkant; het is een compleet spraak-naar-spraak-model. We hebben al Sulafat en SuperWhisper, maar een echte heen-en-weer-spraakstand is echt een apart project.
Ook liet Mike nog een interessante voice-agent zien met een 'second brain', die alles automatisch onthoudt. Jouw kernvraag daarbij was spot-on: je wilt direct met de agent praten die het werk doet, niet via Gemini als tussenpersoon. Daar ben ik het helemaal mee eens, anders heeft het inderdaad weinig zin.
Dus, wat betekent dit concreet voor onze projecten?
Voor het **huis en de verbouwing**: dit is direct toepasbaar en we hebben het 3D-model al. De snelste route is om ons bestaande three.js-model te gebruiken, een camerapad te scripten en dat in de browser te renderen. Dat is mechanisch en precies. Wil je het echt fotorealistisch, dan wordt de Blender/Unreal-route een leertraject van dagen. AI-video's, zoals Kling, zijn dan prima voor sfeershots, maar niet voor de accurate plattegrond-vlucht; AI verzint soms muren die er niet zijn.
Het **winkelcentrum voor Eric**: technisch kan het, dezelfde route als het huis. Maar hier geldt onze VCA-regel: alles rond Eric loopt via de VCA-scheidsrechter. Als je wilt, leg ik het daar neer.
De **salon**: hier zou ik liever geen AI-vlucht doen. Een doorvliegvideo van een bestaand gebouw is minder waard dan een echte, korte opname met een telefoon op een gimbal. Echt beeld past beter bij onze merkregel van 'natuurlijk en echt'. Mocht er ooit een verbouwing komen, dan is een vlucht door de nieuwe indeling natuurlijk wel weer interessant.
De **Apple-app**: een pratende 3D-versie van jezelf voor Dani klinkt gaaf, maar is een enorm en complex project. Ik denk niet dat het op korte termijn beter helpt dan wat we nu hebben. Wat wel snel kan en meer oplevert, is een echte heen-en-weer-spraakstand in de app: Dani praat, Appel antwoordt met de jongensstem Sadachbia. De luister- en spreekkant hebben we, het gaat om de integratie van het gesprek zelf. Dat is een afgebakend bouwblok.
En dan, de **spraakstand in Hermes/Claude**: dit is jouw échte wens. Praten met de agent die het werk doet, zonder Jarvis als tussenpersoon. Wat we al hebben: Claude Code heeft al een dicteerfunctie en Hermes heeft een spraakmodus. Wat ontbreekt, is een stem terug zónder typen en zónder tussenlaag. Dat is een duidelijk afgebakend project: microfoon in, tekst via SuperWhisper, Claude denkt, Sulafat/Sadachbia-stem terug, in één lus. Mike's 'second-brain'-tool is daarbij niet nodig; wij hebben gBrain en Mnemosyne al als geheugen. Die spraakstand van ChatGPT is een eigen model van OpenAI; die krijg je niet zomaar in Claude of Hermes. Maar de spraakmodus van Hermes, met Colette als stem, is al versneld. De kwaliteit van de stem en de snelheid zijn bepalend voor echt 'discussiëren'. Dat moeten we testen.
Mijn voorstel voor de eerste stappen is helder: 1. Laten we een **proefvlucht door het huis** maken met het bestaande three.js-model. Tien seconden, één kamer, mechanisch gerenderd. Jij kijkt, en dan besluiten we verder. 2. Ik vraag Mike nog even naar zijn **precieze stappen en een voorbeeldfilm**. Dan weet ik welk AI-videomodel hij precies bedoelt. 3. Die **spraak-lus met de werk-agent** (een proef van één minuut) zetten we op de lijst, ná de bestel-tool. De Apple-versie met Dani's stem komt daarna. 4. En die **nieuwe computer voor AAS met 64 GB** is zeker een goed idee, zowel voor de zwaardere tools als voor de geheugenproblemen van de MacBook deze week. Afschrijving over vijf jaar, zoals je zelf al zei.
Dit is mijn advies, Jamal. Luister het rustig na, en laat me weten op welke punten je een 'go' geeft. Spreek je snel!
Conductor, 19-9-2026. Bron: Plaud-transcript van Jamals gesprek met Mike (25 min; het AI-deel zit in de eerste 7 minuten, daarna Dani/Appel en eten). Sprekers zijn niet bevestigd door Plaud; ik lees Speaker 2 als Jamal en Speaker 1 als Mike. Waar het transcript ruis is, staat "onzeker".
| Wat | Stand |
|---|---|
| 3D-model van jullie huis (verbouwing) | Ja: exact three.js-model uit jouw SketchUp-plattegrond + 24 renders (M1-M4) op url.haartips.nl/interieur/ |
| Video-generatie | Ja: Kling 2.1 en Grok Imagine via Higgsfield (teamregel) |
| Beeld-generatie | Ja: Gemini 2.5 flash-image |
| Stem | Ja: Sulafat (Gemini TTS), SuperWhisper voor luisteren |
| Blender / Unreal | Nee, niet geïnstalleerd, geen ervaring in de vloot |
1. Het huis (verbouwing): ja, doen.
- Snelste route zonder Blender/Unreal: ons three.js-model heeft al een camera. Een camerapad (vlieg door de woonkamer, keuken, veranda) is een script van een avond, renderen naar mp4 kan in de browser (frames vastleggen). Dat past bij onze regel "mechanisch renderen, geen AI voor wat exact moet kloppen".
- Wil je het écht mooi (fotorealistisch licht): dan SketchUp → Blender (import werkt) → Unreal. Dat is een leertraject van dagen, niet uren. Eerst 1 stil proefje van 10 seconden laten zien voor we die weg inslaan.
- AI-video (Kling) alleen voor sfeershots erbovenop, niet voor de plattegrond-vlucht: AI verzint muren.
2. Winkelcentrum voor Eric: kan, maar VCA-regel.
- Dit is werk voor Eric (Easy Technical Solutions). Volgens de teamregel gaat alles rond Eric via de vca-scheidsrechter. Ik heb dit niet doorgezet omdat het geen VCA-vraag is, maar zeg het als je wilt dat ik het daar neerleg.
- Technisch dezelfde route als het huis: model (heeft hij een tekening?) → three.js of Blender/Unreal.
3. De salon: liever geen AI-vlucht.
- Een doorvliegvideo van een bestaand gebouw is minder waard dan een echte 20-seconden-opname met een telefoon op een gimbal. Echt beeld = merkregel (natuurlijk, echt).
- Wel bruikbaar: een vlucht door de nieuwe salon-indeling ALS jullie ooit verbouwen. Dan zelfde route als het huis.
4. Appel: geen 3D-avatar, wel een stem.
- Een pratende 3D-versie van jezelf voor Dani klinkt leuk, maar is een groot project (3D-scan, Unreal, lipsync, live spraak). Onzeker of het beter helpt dan wat er nu is.
- Wat wél snel kan en meer oplevert: een echte heen-en-weer-spraakstand in Appel (Dani praat, Appel antwoordt met de jongensstem Sadachbia). De luister-kant hebben we (SuperWhisper/faster-whisper), de spreek-kant ook. Ontbreekt: het gesprek zelf zonder typen. Dat is een afgebakend bouwblok.
5. Spraakstand in Hermes/Claude: dit is de echte wens.
- Jouw zin uit het gesprek is de kern: praten met de agent die het werk doet. Jarvis (Gemini) is een tussenpersoon. Wat we al hebben: Claude Code heeft /voice (dicteren, werkt sinds 11-9 op de MacBook) en Hermes heeft een spraakmodus. Wat ontbreekt: een stem terug zonder typen én zonder tussenlaag. Dat is een afgebakend bouwblok: microfoon → tekst (SuperWhisper/faster-whisper) → Claude-agent → Sulafat/Sadachbia-stem, in één lus. Eerst 1 proef van 1 minuut laten horen.
- Mike's second-brain-tool: naam onbekend; we hebben gBrain + Mnemosyne al als geheugen. Ik hoef daar geen nieuwe tool voor.
- ChatGPT's spraakstand is een spraak-naar-spraak-model van OpenAI; dat krijg je niet in Claude of Hermes. Wat wel kan: Hermes heeft al een spraakmodus (Whisper + stem Colette, PA versnelde die deze week). Voor "echt discussiëren" is de kwaliteit van de stem én de snelheid bepalend; dat is te testen, niet te beloven.
Dit is advies. Zeg go op de punten die je wilt.
🎙️ Bespreek met Jarvis