Haarvisie verslagen
← Alle verslagen📄 Download als PDF
🎧 Luister dit verslag
1,0x
⬇️ Download naar telefoon
📖 Lees mee met de podcast

Hoi Jamal, welkom bij deze update over onze zoektocht naar die perfecte AI-geanimeerde dansgroep! We duiken vandaag in de nieuwste bevindingen rondom het behouden van gezichtsconsistentie voor een groep van zes dansende personen met behulp van AI-videogeneratie. Het is een uitdagende klus, maar we hebben een aantal interessante dingen ontdekt.

De kern van het verhaal is dit: hoewel je AI-modellen absoluut gezichtsreferenties kunt meegeven, hebben we geen methode gevonden die een *aantoonbaar gegarandeerde 'facelock'* biedt voor zes dynamisch dansende mensen. Dat zijn dus twee verschillende dingen: je kunt referenties invoeren, maar dat garandeert nog geen perfecte, onveranderlijke gezichten door de hele animatie heen. De referenties kunnen weliswaar meebewegen, maar een absolute ‘facelock’ – die keiharde garantie dat de gezichten van al die dansers nooit afwijken – is simpelweg nog niet gevonden.

Om dit beter te begrijpen, hebben we de openbare videowerkruimtes van verschillende tools flink onder de loep genomen. We keken naar Kling 3.0 Omni, Kling O1 Video en Seedance 2.0. We hebben daarbij de modelinstellingen geopend, zonder foto’s te uploaden of een generatie te starten, puur om te zien hoe de interfaces werken.

Wat viel op? Bij Kling 3.0 Omni heeft de ‘Elements’-stand een optie om "consistent elements" toe te voegen voor een personage of object. Als je vervolgens overschakelt naar ‘Frames’, zie je een ‘Start frame’ en ‘End frame’ invoer. Bij Kling O1 Video zien we ‘Elements’ en ‘Frames’ als aparte keuzestanden, en hier is de ‘Elements’-invoer ook daadwerkelijk zichtbaar. Seedance 2.0 heeft een gecombineerde media-invoer en een aparte ‘Elements’-knop.

Handig om te weten: onze browsersessie was niet ingelogd. Het systeem gaf aan dat authenticatie nodig is om iets te genereren, maar dat zegt natuurlijk niets over een eventuele login in een ander browserprofiel.

We moeten ook een kleine correctie doorvoeren op eerder advies: het blijkt dat losse personagereferenties én een vast begin- en eindframe in de bekeken Kling-interface niet zomaar tegelijkertijd beschikbaar zijn. En een belangrijke nuance: zeven referentiebeelden betekenen niet automatisch zeven betrouwbaar vastgezette personen. Het draait om de kwaliteit en de consistentie van de output, niet alleen om de inputcapaciteit.

We hebben specifieke routes onderzocht binnen de Higgsfield-werkruimte om te zien welke de meeste potentie heeft. * **Kling O1 Video, Elements-stand:** De documentatie van Higgsfield spreekt hier van maximaal zeven beeldreferenties, en we hebben de ‘Elements’-stand live gezien. Op papier zou dit een groepsbasis plus zes gezichtsreferenties kunnen huisvesten. Maar, en dit is een cruciale kanttekening, een betrouwbare uitvoering met zes personen is nog niet getest. * **Kling 3.0 Omni, Elements-stand:** Hier hebben we de personage-invoer live gezien, met een aparte ‘Frames’-stand. Dit is een geschikte kandidaat voor personagereferenties, maar het maximum aantal personen dat het betrouwbaar aankan, is nog niet vastgesteld. * **Seedance 2.0:** Het helpcentrum noemt negen afbeeldingen, en we hebben de media-invoer en ‘Elements’-knop live gezien. Er is dus zeker ruimte voor een groepsbasis en zes portretten, maar we moeten nog testen hoe goed de afzonderlijke koppeling en gelijkenis behouden blijven.

Ter aanvulling: de Higgsfield-handleiding voor Kling O1 spreekt dus van zeven beeldreferenties. Als technische kruiscontrole noemt de ‘fal’-documentatie van Kling O1 Reference ook zeven invoereenheden in totaal, waaronder elementen, referentiebeelden en een startbeeld. Maar deze ‘fal’-interface bewijst niet dat Higgsfield exact dezelfde combinaties aanbiedt, en we hebben ook niets naar ‘fal’ gestuurd. Het actuele Seedance-helpcentrum maakt overigens onderscheid tussen een personagereferentie binnen een clip en een opgeslagen ‘Element’ voor hergebruik. Ze noemen negen afbeeldingen voor Seedance 2.0 en wel dertig voor Seedance 2.5! Maar onthoud: meer invoer betekent niet automatisch een betere kwaliteit in gezichtsbehoud.

Dan nu een concreet voorstel voor *deze* opdracht. Mijn voorkeur voor een eerste gecontroleerde proef gaat uit naar Kling O1 Video in de ‘Elements’-stand. De referentiecapaciteit is daarvoor concreet gedocumenteerd, wat een praktisch startpunt biedt. Het is geen bewezen winnaar tegenover Omni of Seedance, maar een logische eerste stap.

Hier zijn de stappen die we zouden volgen: 1. Gebruik de goedgekeurde pastelcompositie als scènereferentie. 2. Voeg voor iedere persoon een scherpe, *originele* gezichtsreferentie toe. Nummer de personen van links naar rechts en koppel die volgorde nauwkeurig in de prompt. Gebruik hierbij geen opnieuw gegenereerde portretten als identiteitsbron; we willen de puurste referenties. 3. Houd één vaste camera, zorg dat alle personen in beeld blijven en beperk de hoofdbewegingen tot klein. De groep staat op, danst rustig, en keert terug naar de beginhouding. Na afloop is het cruciaal om een eventuele loop nauwkeurig te controleren op de overgang. 4. Animeer bij voorkeur de versie zonder logo en slogan. Plaats de originele merklaag achteraf over de video. Zo voorkom je dat het videomodel logo en letters opnieuw probeert te tekenen, wat vaak tot fouten leidt. 5. En misschien wel het allerbelangrijkste: controleer alle zes gezichten door de *hele* clip heen. Een goede eerste afbeelding of enkele steekproeven zijn geen bewijs van een foutloze video.

Er zit wel een extra moeilijkheid in deze specifieke opdracht: de bronfoto toont zittende mensen achter een tafel. Opstaan vraagt van het model dat het nieuwe lichaamsdelen en houdingen moet reconstrueren. Dat maakt deze opdracht lastiger dan alleen kleine bewegingen in een reeds bestaande pose. Dit is een inschatting van de compositie, geen gemeten modelscore.

Waar de harde grens blijft: Higgsfield beschrijft zelf dat referentiebeelden kunnen gaan afwijken wanneer omstandigheden veranderen. Termen als ‘facelock’ of ‘identity lock’ in een prompt zijn daarom geen garantie. Er is tijdens dit onderzoek geen geteste dansvideo opgeleverd en we hebben ook geen nieuwe renders gestart. Voor de absolute eis dat gezichten *niet* worden hertekend, is echte dansvideo met de gezichten behouden in de montage een veel betrouwbaardere werkwijze. Dat vraagt ander bronmateriaal en is geen vervanging die stilzwijgend kan worden uitgevoerd.

Dus Jamal, we staan voor een uitdagende taak, maar met deze inzichten en een gecontroleerde aanpak hoop ik dat we stappen kunnen zetten richting die vloeiende, gezichtsconsistente dansanimatie. Laten we voorzichtig te werk gaan en nauwkeurig evalueren!

Higgsfield: gezichtsreferenties voor een dansende groep

Gezichtsreferenties kunnen mee. Een aantoonbaar gegarandeerde facelock voor zes dansende personen is niet gevonden. Dat zijn twee verschillende conclusies.

Nieuw: de werkruimte zelf gecontroleerd

In de openbare videowerkruimte zijn modelinstellingen geopend, zonder foto's te uploaden of een generatie te starten.

Correctie op het eerdere advies: losse personagereferenties en een vast begin- én eindframe zijn in de bekeken Kling-interface niet zomaar tegelijkertijd beschikbaar. Ook zijn zeven referentiebeelden geen bewijs van zeven betrouwbaar vastgezette personen.

Werkruimte Higgsfield

Welke route is het onderzoeken waard?

Route Vastgesteld Betekenis voor zes personen
Kling O1 Video, Elements Higgsfield documenteert maximaal zeven beeldreferenties; de Elements-stand is live gezien. Een groepsbasis plus zes gezichtsreferenties past op papier. Een betrouwbare uitvoering met zes personen is niet getest.
Kling 3.0 Omni, Elements Personage-invoer live gezien, aparte Frames-stand. Geschikte kandidaat voor personagereferenties; maximum aantal personen niet vastgesteld.
Seedance 2.0 Helpcentrum noemt negen afbeeldingen; media-invoer en Elements live gezien. Ruimte voor groepsbasis en zes portretten, maar de afzonderlijke koppeling en gelijkenis moeten nog worden getest.

De Higgsfield-handleiding voor Kling O1 noemt zeven beeldreferenties. Als technische kruiscontrole noemt de fal-documentatie van Kling O1 Reference zeven invoereenheden in totaal: elementen, referentiebeelden en startbeeld samen. Die fal-interface bewijst niet dat Higgsfield dezelfde combinaties aanbiedt. Er is niets naar fal verstuurd.

Het actuele Seedance-helpcentrum maakt onderscheid tussen een personagereferentie binnen een clip en een opgeslagen Element voor hergebruik. Het noemt negen afbeeldingen voor Seedance 2.0 en dertig voor Seedance 2.5. Meer invoer betekent niet automatisch betere gezichtsbehoudkwaliteit.

Concreet voorstel voor deze opdracht

Mijn voorkeur voor een eerste gecontroleerde proef is Kling O1 Video in Elements-stand, omdat de referentiecapaciteit daarvoor concreet is gedocumenteerd. Dit is een praktisch startpunt, geen bewezen winnaar tegenover Omni of Seedance.

  1. Gebruik de goedgekeurde pastelcompositie als scènereferentie.
  2. Voeg voor iedere persoon een scherpe originele gezichtsreferentie toe. Nummer personen van links naar rechts en koppel die volgorde in de prompt. Gebruik geen opnieuw gegenereerde portretten als identiteitsbron.
  3. Houd één vaste camera, alle personen in beeld en kleine hoofdbewegingen. De groep staat op, danst rustig en gaat terug naar de beginhouding. Een loop moet daarna werkelijk op de overgang gecontroleerd worden.
  4. Animeer bij voorkeur de versie zonder logo en slogan. Zet de originele merklaag achteraf boven de video; dan worden logo en letters niet opnieuw door het videomodel getekend.
  5. Controleer alle zes gezichten door de hele clip. Een goede eerste afbeelding of enkele steekproeven bewijzen geen foutloze video.

De bronfoto toont zittende mensen achter een tafel. Opstaan vraagt dat het model nieuwe lichaamsdelen en houdingen reconstrueert. Dat maakt deze opdracht lastiger dan alleen kleine bewegingen in de bestaande foto. Dit is een inschatting van deze compositie, geen gemeten modelscore.

Waar de harde grens blijft

Higgsfield beschrijft zelf dat referentiebeelden kunnen gaan afwijken wanneer omstandigheden veranderen. Termen als facelock of identity lock in een prompt zijn daarom geen garantie. Er is geen geteste dansvideo opgeleverd en er zijn tijdens dit onderzoek geen nieuwe renders gestart.

Voor de absolute eis dat gezichten niet worden hertekend, is echte dansvideo met de gezichten behouden in de montage een betrouwbaardere werkwijze. Dat vraagt ander bronmateriaal en is geen vervanging die stilzwijgend wordt uitgevoerd.

🎙️ Bespreek met Jarvis