Ha Jamal, Kimi hier met een belangrijke update over de nieuwste ontwikkelingen rondom Google Gemini en Google Voice. Dit bouwt voort op het eerdere onderzoek van Conductor en is aangevuld met de meest recente informatie. De kern is: er zijn spannende dingen gebeurd, maar we blijven voorzichtig.
Even de belangrijkste punten op een rijtje, maar dan in lekker lopende zinnen. Google heeft op 21 juli nieuwe, efficiënte Gemini-modellen uitgebracht, zoals Gemini 3.6 Flash. Deze zijn goedkoper, sneller en specifiek ontworpen voor AI-agents. Geen totale revolutie, maar wel direct bruikbaar en een flinke stap vooruit in efficiëntie.
Voor onze podcasts verandert er wat Sulafat betreft vrijwel niks. Ze blijft onze vertrouwde stem, dat staat vast. Wel is er een nieuwer TTS-model, versie 3.1, dat we één keer kunnen testen om te kijken of de kwaliteit nóg beter is. Het blijft wel zo dat de kwaliteit van de stem na een paar minuten wat inzakt, dus de teksten moeten we nog steeds in kleine stukjes aanleveren.
Maar de echt grote doorbraak zit ‘m in de Gemini Live API. Dit is de technologie waarmee je echt, real-time, met een AI kunt praten. En de kosten daarvan zijn nu ongelofelijk laag: ongeveer 2,3 cent per gespreksminuut. Dat is maar liefst drie tot vijf keer goedkoper dan wat we nu betalen voor ElevenLabs. Dat is een serieus verschil als je veel gesprekken hebt.
Toch betekent dit niet dat we onze Roos, onze telefoonstem, nu direct moeten overzetten. ElevenLabs is namelijk nog steeds superieur in de Nederlandse stemkwaliteit; de stemmen klinken daar het meest natuurlijk, en Roos is inmiddels een herkenbare stem voor de salon. Kimi's eerlijke advies is dan ook om niet klakkeloos over te stappen, maar eerder te denken aan een hybride oplossing: misschien de heel simpele gesprekken, zoals afspraakbevestigingen of openingstijden, via Gemini Live, en de échte, merkgebonden gesprekken bij Roos houden.
De grootste winst zit ‘m trouwens in onze tekst-agents en bots die we gebruiken voor blogs, research of het routeren van taken. De nieuwe Flash-modellen zijn daar gewoon goedkoper én sneller voor.
Daarom stelt Kimi een drietal kleine proeven voor. Geen grote migraties, maar gericht meten. Eerst maken we één keer dezelfde podcast met het nieuwe 3.1 TTS-model, zodat jij het verschil kunt horen en kiezen. Ten tweede draaien we één terugkerende bot-taak op Gemini 3.6 Flash om de kosten en snelheid te meten ten opzichte van de huidige situatie. En ten slotte, optioneel, kunnen we een minimale Gemini Live testbot opzetten die alleen openingstijden en afspraakbevestigingen doet. Puur om te horen hoe het klinkt in het Nederlands.
Het idee is duidelijk: geen overhaaste stappen. Eerst meten, dan weloverwogen beslissen. Kimi zorgt dat elke proef eerst door jou wordt goedgekeurd voordat er iets live gaat. Dat was het voor nu!
Samengesteld door Kimi, voortbouwend op Conductor's eerdere research (4 verslagen, juni 2026).
Aangevuld met verse web-research van 25 juli 2026. Alle bedragen en claims hebben een bron.
Onzekere punten zijn eerlijk gemarkeerd met "let op".
Conductor heeft dit onderwerp op meerdere pagina's uitgezocht. Die research heb ik gebruikt, niet opnieuw gedaan:
Wat daar in juni al uitkwam:
| Optie | Tarief per gespreksminuut | Snelheid | NL-stemkwaliteit |
|---|---|---|---|
| Gemini Live | circa $0,023 | 250-500 ms | goed, maar geen vaste "eigen" stem |
| ElevenLabs (Roos) | $0,08 tot $0,12 | 500-800 ms | de beste, inclusief voice cloning |
| OpenAI Realtime | $0,06 tot $0,15 | circa 320 ms | geen voordeel voor NL |
Wat dit betekent, eerlijk gezegd:
Geen grote migratie. Eerst meten, dan beslissen. Jij keurt elke proef goed voordat er iets live gaat.