---
title: "Liplezen met AI: wat je lippen niet verraden"
date: 2026-10-01
author: "Daan Koster"
featured_image: "https://watisai.nl/wp-content/uploads/2026/10/liplezen-ai-hoe-werkt-het.jpg"
categories:
  - name: "AI nieuws"
    url: "/category/ai-nieuws.md"
---

# Liplezen met AI: wat je lippen niet verraden

![Illustratie: een jonge vrouw houdt aan de keukentafel drie kaartjes met precies dezelfde getekende mond omhoog, een oudere vrouw kijkt fronsend van de kaartjes naar haar lippen, naast hen een open machinekast met een cameraatje die papiertjes sorteert](https://watisai.nl/wp-content/uploads/2026/10/liplezen-ai-hoe-werkt-het.jpg)Illustratie: WatisAI.nlZeg eens zonder geluid “bier” tegen iemand aan de andere kant van de kamer. Dan “pier”. Dan “mier”. Je lippen gaan drie keer dicht, drie keer open, en je tong zit achter je tanden waar niemand hem ziet. Wie naar je kijkt en probeert te liplezen, ziet drie keer hetzelfde woord.

Dat probleem heeft een computer ook. Sinds vanochtend gaat er een gratis app rond die het probeert.

Amy ([@amypretzel](https://x.com/amypretzel/status/2105496934672965669)), die volgens haar profiel bij Vizcom werkt en eerder bij Apple zat, postte donderdag om 05.16 uur Nederlandse tijd een filmpje van Lipflow: je houdt een toets ingedrukt, beweegt je lippen zonder geluid, en de tekst verschijnt waar je cursor staat.

Haar reden: “i wanted to voice dictate without bothering everyone”. Rond 07.25 uur stond de post op 268 likes en 10.676 weergaven.

Hoe goed zo’n liplezer werkt, hangt aan één vraag: hoeveel woorden zien er op je lippen hetzelfde uit? Voor het Nederlands had niemand dat geteld, dus deden we het zelf.

## Hoe “hello jack” toch “Hello Jake” werd

Het mooiste moment in Amy’s video duurt twee seconden. Ze typt een bericht aan ene Jake.

Terwijl ze haar lippen beweegt, toont de app onderin wat hij al denkt te lezen: eerst “hello”, daarna “hello jack”. Die live tekst is een snelle gok die de app elke 0,45 seconde ververst.

![Twee momenten uit de Lipflow-demo: een close-up van een mond met gevolgde lippunten, met eronder de voorlopige tekst hello en daarna hello jack](https://watisai.nl/wp-content/uploads/2026/10/lipflow-preview-hello-jack.jpg)De live voorspelling tijdens het mompelen: eerst “hello”, dan “hello jack”. Stills uit de video van [@amypretzel](https://x.com/amypretzel/status/2105496934672965669), 1 oktober 2026.Wat er uiteindelijk in het berichtveld landt, is “Hello Jake, my name is Amy.” Met hoofdletter, komma en punt.

Jack en Jake zien er op de lippen bijna hetzelfde uit. Het verschil zit in één klinker, en de k maak je achter in je mond waar niemand hem ziet.

Dat de app toch Jake kiest, heeft niets met betere ogen te maken. In de [code](https://github.com/amywork777/lipflow/blob/main/lipflow/context.py) staat dat Lipflow bij het indrukken van de toets het venster leest waarin je typt, via de toegankelijkheidsfuncties van macOS.

Daar haalt hij namen uit, zoals de naam van degene met wie je chat.

Die namen gaan mee naar het taalmodel dat de zin opschoont, met de opdracht ze te kiezen als een gelezen woord erop lijkt. Welke stap van jack Jake maakte, zie je niet in de video. Wel dat Jake in beeld stond.

## Waarom een camera “while in office” als “wallet officer” leest

Klanken die je hoort, zijn niet dezelfde als klanken die je ziet. Een p, een b en een m zien er allemaal uit als twee lippen die even op elkaar gaan.

Een f en een v zijn allebei tanden op je onderlip. Een t, d, n, s en l gebeuren achter je tanden. Taalkundigen noemen zo’n zichtbare mondvorm een viseem.

Amy schrijft het zelf eerlijk in de [uitleg bij Lipflow](https://github.com/amywork777/lipflow): liplezen kan woorden die er op de lippen hetzelfde uitzien niet uit elkaar houden, dus maakt het model van “while in office” iets als “WALLET OFFICER”.

Het model onder Lipflow heet [Auto-AVSR](https://arxiv.org/abs/2303.14307) en komt van onderzoekers van Imperial College London. Het is getraind op LRS3, een grote verzameling fragmenten van TED-sprekers. Het werkt in drie stappen, en dat zijn gewone onderdelen van [neurale netwerken](https://watisai.nl/neurale-netwerken/):

1. Een gezichtsherkenner zoekt op elk camerabeeld je ogen, neus en mond en knipt een vierkantje van 96 bij 96 pixels rond je lippen uit, 25 keer per seconde.
2. Een netwerk kijkt naar die reeks mondjes en rekent uit welke klankstukjes erbij horen.
3. Een klein taalmodel helpt bij het zoeken naar de zin die het best past. De beste gokken gaan door naar de laatste stap.

Op de testset van LRS3 gaat volgens de README 19,1 procent van de woorden fout. Bij de fluisterstand noemt de README voor testzinnen 31,9 procent foute woorden als de app alleen naar de lippen kijkt. Bijna één op de drie.

En stil gemompelde woorden voor je eigen webcam zijn volgens dezelfde README nog lastiger dan gewoon gefilmde spraak, omdat je lippen dan minder bewegen.

## Eén lipbeeld, 67 Nederlandse woorden

Lipflow werkt alleen in het Engels. Op de vraag van een lezer of andere talen eraan komen, [antwoordde Amy](https://x.com/amypretzel/status/2105519285640818718): “Ooh not yet but feel free to add languages to the repo!” Wij wilden weten of het Nederlands het een liplezer makkelijker of moeilijker maakt dan het Engels.

Daarom pakten we de lipvorm-indeling die Lipflow zelf gebruikt (negen groepen, zoals “lippen dicht” voor p, b en m) en zetten die om naar Nederlandse spelling, met ij, ui, oe, sch en de zachte g erbij.

Die hebben we losgelaten op de 5.000 meest gebruikte woorden uit ondertitels, voor het Nederlands én het Engels. Een woord telt als dubbelganger als minstens één ander woord in de lijst exact dezelfde reeks lipvormen heeft.

![Staafgrafiek: de vijf grootste groepen Nederlandse woorden met hetzelfde lipbeeld, met 67 woorden in de groep van dat, zijn en dan, en onderaan 56,1 procent voor Nederlands tegen 56,2 procent voor Engels](https://watisai.nl/wp-content/uploads/2026/10/liplezen-homofenen-grafiek.jpg)Eigen meting, 1 oktober 2026. Lipvorm-indeling uit Lipflow, woordenlijst [FrequencyWords](https://github.com/hermitdave/FrequencyWords) (ondertitels). Grafiek: WatisAI.nlWoordenlijstNederlandsEngels1.000 meest gebruikte woorden54,3% heeft een dubbelganger49,4%5.000 meest gebruikte woorden56,1%56,2%Grootste groep met één lipbeeld67 woorden (dat, zijn, dan, zal, laat, tijd…)55 woorden (let, tell, last, dad…)Bron: eigen telling WatisAI.nl, 1 oktober 2026Ruim de helft van de woorden die je dagelijks gebruikt heeft dus een dubbelganger op je lippen. In het Nederlands net zo goed als in het Engels.

“Doen” en “toen” zijn identiek, “met” en “bed” ook, en in de grootste groep zitten “dat”, “zijn”, “dan” en “laat” samen met nog 63 andere woorden.

Twee dingen bewijst deze telling niet. De indeling is grof: Lipflow gooit de a en de e in dezelfde groep, en wij volgen dat. In het echt zie je best verschil tussen een open a en een brede ee, dus de groepen zijn in werkelijkheid kleiner.

En we rekenen met spelling, niet met uitspraak. Het is een ruwe maat voor hoe vaak een liplezer moet gokken, geen meting van het model zelf.

## De camera leest, het taalmodel raadt

Als ruim de helft van je woorden een dubbelganger heeft, komt de nauwkeurigheid niet uit de camera. Die komt uit het raden. Lipflow geeft de drie beste gokken van de liplezer plus je laatste dictaten aan een tweede AI, een klein [large language model](https://watisai.nl/large-language-models/).

Zonder extra instellingen is dat Qwen3 van 0,6 miljard parameters, lokaal op je Mac. Wie een sleutel van Anthropic invult, krijgt Claude. Dat model kiest de zin die je waarschijnlijk bedoelde en zet de hoofdletters en leestekens goed.

Daar zit volgens ons de echte les van dit project. Liplezen door AI is vooral een raadspel met context. Wie je bent, tegen wie je praat, wat je vorige week typte: dat bepaalt of “wallet officer” weer “while in office” wordt.

Lipflow kan je dicteergeschiedenis uit Wispr Flow inlezen om je eigen zinnen te leren. Het is slim gedaan, en het betekent ook dat zo’n app je beter moet kennen om je goed te verstaan.

## Eén op de drie woorden fout is corrigeren, geen dicteren

![Amy praat in de camera, ondertitel: but I don't want people in public thinking I'm crazy talking to my computer](https://watisai.nl/wp-content/uploads/2026/10/lipflow-amy-niet-gek-in-het-openbaar.jpg)Amy legt uit waarom ze de app bouwde. Still uit de video van [@amypretzel](https://x.com/amypretzel/status/2105496934672965669)De reacties onder de post zijn bijna allemaal enthousiast. Mike Holzbauer [schreef](https://x.com/mholzbauer/status/2105511431063957991) dat iedereen zegt dat praten tegen je computer de toekomst is, maar dat hij niet iedereen om zich heen tegen een laptop wil horen praten.

Daar zit iets in, en wij zijn net zo enthousiast. Alleen loopt dat enthousiasme voor stil dicteren nu net zo hard voor de feiten uit als het enthousiasme voor spraak eerder deed.

Eén op de drie woorden fout zonder hulp betekent dat je meer tijd kwijt bent aan verbeteren dan aan zeggen. Amy’s demo is één korte zin van vijf woorden.

En de README zegt zelf dat de stand waarin je toch zachtjes fluistert de nauwkeurigste is: lippen plus geluid gaven op de testzinnen 6,9 procent fout.

Een echte fluistering is minder duidelijk dan die testclips, schrijft Amy erbij, dus reken op iets daartussenin. Een andere bouwer, [stingerbang](https://x.com/brohdahfirst1/status/2105514879763513622), reageerde dat hij dit meerdere keren had geprobeerd en het nooit nauwkeurig genoeg kreeg.

Dat is geen afkraken van het project. Het is precies waarom het taalmodel erachter het halve werk doet.

## Zie jij het verschil tussen doen en toen?

1. Zet de selfiecamera van je telefoon aan en neem vijf seconden op.
2. Zeg zonder geluid “doen” en daarna “toen”.
3. Kijk het terug met het geluid uit. Zie je het verschil?
4. Doe hetzelfde met “met” en “bed”.

Na twee paar snap je waarom een liplezer, mens of machine, steeds moet raden. Dat is in het klein waar het bij [wat is AI](https://watisai.nl/) steeds om draait: patronen herkennen en de waarschijnlijkste uitkomst kiezen.

Wie wil weten hoe zo’n model zijn gokken leert, leest bij ons [stap voor stap](https://watisai.nl/hoe-werkt-ai/) hoe [machine learning](https://watisai.nl/machine-learning/) werkt.

## Wie traint de eerste Nederlandse liplezer?

Onze telling laat zien dat het Nederlands op de lippen niet lastiger is dan het Engels. Het probleem zit ergens anders: er moet een model komen dat Nederlandse monden heeft gezien. LRS3 bestaat uit fragmenten van het YouTube-kanaal van TED.

De onderzoeksgroep achter Auto-AVSR heeft in haar [modelbibliotheek](https://github.com/mpc001/Visual_Speech_Recognition_for_Multiple_Languages) ook liplezers voor het Spaans, Portugees en Frans staan. Die zitten op 44,5 tot 58,6 procent foute woorden, ruim boven de 19,1 procent van het Engels. Nederlands staat er niet tussen.

Amy nodigt iedereen uit om talen toe te voegen aan de code. Zolang er geen groot Nederlands videoarchief met uitgeschreven tekst en een bruikbare licentie bestaat, blijft dat aanbod voor het Nederlands vooral een uitnodiging.