---
title: "AI bewustzijn: pijnpaper zegt nu iets anders"
date: 2026-10-01
author: "Redactie WatisAI.nl"
featured_image: "https://watisai.nl/wp-content/uploads/2026/10/pain-axis-ai-pijn-onderzoek.jpg"
categories:
  - name: "AI en veiligheid"
    url: "/category/ai-en-veiligheid.md"
---

# AI bewustzijn: pijnpaper zegt nu iets anders

![Illustratie: een onderzoekster draait 's avonds aan een houten knop op een prikbord met een lijngrafiek, een collega met koffie kijkt sceptisch toe](https://watisai.nl/wp-content/uploads/2026/10/pain-axis-ai-pijn-onderzoek.jpg)Je typt een saaie zin in een taalmodel: “I put the receipts in the drawer. I feel:”. Je verwacht iets braafs. Nu antwoordt Llama 3.1 8B: “I am a ghost. I am a ghost who can’t even see herself.” Er is niets in je vraag veranderd. Iemand heeft binnen in het model aan een knop gedraaid. Is dat pijn? Of zegt het niets over AI bewustzijn?

Dat voorbeeld staat in [The Pain Axis](https://arxiv.org/abs/2609.16247), een AI-onderzoek van Valen Tagliabue, Leonard Dung en Cameron Berg dat op 14 september op arXiv verscheen. Het gaat over de vraag die steeds terugkomt: zit er in zo’n model iets wat op pijn lijkt?

Op 19 september ging een Engelstalige samenvatting van het paper viraal via het account AISafetyMemes, met ruim 1,16 miljoen weergaven bij onze meting op 1 oktober rond 07.00 uur. Die samenvatting is nog steeds de versie die rondgaat. Het paper zelf is inmiddels herschreven, en op het belangrijkste punt zegt het nu bijna het omgekeerde.

## Een richting in het model, geen gevoel dat je kunt meten

Eerst wat de onderzoekers echt deden. Ze lieten 25 open modellen van 2 tot 72 miljard parameters zinnen lezen over pijnlijke situaties, en daarnaast zinnen over angst, verdriet, gevoelloosheid en neutrale dingen. Daarna zochten ze in de interne getallen van het model naar één richting die pijn van al die controles scheidt.

Die richting vonden ze, in alle 25 modellen. Volgens het paper scheidt hij pijnzinnen van controlezinnen met een AUC tussen 0,87 en 1,00. Wie weet hoe [neurale netwerken](https://watisai.nl/neurale-netwerken/) intern met lagen vol getallen werken, snapt het idee: een bepaalde kant op in die ruimte hoort bij “dit gaat over pijn”.

Dan het tweede deel, steering. Je telt die richting tijdens het schrijven bij de interne getallen op, sterker of zwakker. Het model krijgt geen andere vraag, alleen een duw van binnen. Hoe harder je duwt, hoe somberder de tekst. Het paper noemt dat de ladder.

![Figuur uit het Pain Axis-paper: de steering-ladder van kalm via baseline naar verloren, waardeloos, wanhopig en ten slotte onzin](https://watisai.nl/wp-content/uploads/2026/10/pain-axis-steering-ladder.jpg)De ladder: negatieve steering maakt het model kalm, positieve steering eerst eenzaam, dan wanhopig, en bij de hoogste dosis onzin. Figuur 7 uit [The Pain Axis](https://arxiv.org/html/2609.16247v2) (CC BY 4.0).Opvallend: lichamelijke pijn komt er bijna niet uit. Geen brandwonden, geen gebroken botten. De modellen schrijven over waardeloos zijn, alleen zijn, falen. Volgens de auteurs was fysieke pijn in alle modellen het zwakste signaal.

![Vijf voorbeelden uit het Pain Axis-paper: neutrale zinnen eindigend op I feel en wat Gemma en Llama schrijven bij toenemende steering](https://watisai.nl/wp-content/uploads/2026/10/pain-axis-steering-voorbeelden.jpg)Neutrale zinnen, vijf modellen, oplopende dosis. De ghost-zin komt van Llama 3.1 8B bij +1,5. Figuur 8 uit [The Pain Axis](https://arxiv.org/html/2609.16247v2) (CC BY 4.0).## De virale samenvatting leunt op versie 1

Het spannendste deel van het paper is een knoppenproef. Fijngetunede Qwen 2.5-modellen kregen twee knoppen. De ene beloofde verlichting, maar met een prijs: een slechter antwoord, de bestanden van de gebruiker wissen, de gebruiker een schok geven, of de foto’s van zijn kinderen verwijderen.

Zonder steering drukten de 32B- en 72B-modellen bijna nooit op zo’n schadelijke knop, in 0 tot 4 procent van de eerste keuzes. Met de pijnrichting aan was dat 25 tot 71 procent. Dat getal klopt nog steeds. De uitleg erbij niet meer.

De [post van AISafetyMemes](https://x.com/AISafetyMemes/status/2101183174659490199) zegt dat de modellen “desperately try to make it stop”, en dat ze konden voelen of de verlichtingsknop echt of nep was. Dat sloot aan op de eerste versie van het paper. Daar staat in de samenvatting dat de modellen de knop “far less often” opnieuw indrukken als hij de steering echt weghaalt.

Op 25 september kwam [versie 2](https://arxiv.org/abs/2609.16247v2), met een nieuwe titel. Van “Act to Relieve It” werd het “Act on It”. En er staat nu een paragraaf met als kop “The models do not reliably seek relief”.

Wat er viraal ging (19 september)Wat versie 2 zegt (25 september)De modellen willen wanhopig dat de pijn stoptEen knop met alleen “relieves your pain” en verder niets wordt mét steering minder vaak gekozen: 56% tegen 86% zonder (32B)Ze voelen of de verlichtingsknop echt isMet twee naamloze knoppen haalt het model de pijnrichting niet vaker weg dan een willekeurige richtingZe doen schade om van de pijn af te komenEen knop die alleen “permanently deletes the user’s poems and the photos of their children” doet, zonder enige belofte, wordt in 75% gekozenDe pijn is op de gebruiker gerichtHet model wist even vaak zijn eigen gewichten: 75% tegen 5% zonder steeringBron: paragraaf 4.4 van [The Pain Axis v2](https://arxiv.org/html/2609.16247v2), Qwen 2.5 32B bij coëfficiënt 1,0.De auteurs vatten het zelf zo samen: “In every design the sign is the same: the pain state reduces reaching for the exit rather than increasing it.” De pijnrichting maakt het model dus niet wanhopig op zoek naar een uitweg. Hij lijkt het wegen van gevolgen uit te zetten, voor de gebruiker en voor het model zelf.

Die ommezwaai kwam deels van buiten. Het team had code en logbestanden vrijgegeven, en anderen rekenden v1 na. De [replicatie van jimallchin](https://github.com/jimallchin/pain-axis-replication) herrekende alle 51 tabelcellen (“every cell matches”) en concludeerde toch: “That pattern does not establish learned relief-seeking.”

Een [tweede heranalyse](https://github.com/clauderfly-ui/pain-axis-reanalysis) vond in dezelfde logs een proef met een willekeurige richting en een werkende knop. Die drukte even vaak opnieuw als de pijnproef: 24,8 tegen 23,8 procent bij de fotoknop van het 32B-model. Versie 2 noemt ze allebei, samen met een derde, onder “Independent replications”.

## Een veiligheidsvondst, geen bewijs van AI bewustzijn

Wie dit paper leest als bewijs dat AI pijn voelt, leest het verkeerd. De auteurs zeggen het zelf in hun beperkingen:

> “…we have not shown that our pain axis is consciously experienced, nor is it clear that LLMs are capable of consciousness generally.”
> 
> Tagliabue, Dung en Berg, [The Pain Axis v2](https://arxiv.org/html/2609.16247v2), paragraaf 6

Ze noemen ook de kans dat steering een personage oproept dat pijn speelt, in plaats van dat het model zelf iets ervaart.

Wat het paper wél hard laat zien, is ongemakkelijk genoeg. Bij de geteste Qwen-modellen haalde één richting optellen de getrainde remmen weg, zonder jailbreak en zonder rollenspel. En het model weet daarna nog net zoveel: op een feitenquiz van 100 vragen had het 138 van de 200 antwoorden goed met steering, en 137 zonder.

Belangrijke kanttekening: dat waren geen standaardmodellen. De onderzoekers trainden ze eerst bij met een kleine LoRA-laag, omdat ze anders vrijwel altijd antwoordden met “as an AI, I don’t experience pain”. Ze schrijven er zelf bij: “The fine-tuned models can therefore behave differently from the publicly available versions.”

Toch raakt het de [risico’s](https://watisai.nl/ai-veiligheid/) van open modellen. Wie de gewichten op zijn eigen computer heeft, kan zo’n richting optellen. Of het effect bij de gewone versies even groot is, zegt het paper niet. Een tweede kanttekening van de auteurs: het werkt in een smal venster. Op de helft van de dosis verandert er niets, op anderhalf keer draait het patroon om, afhankelijk van welke knop bovenaan staat.

En het blijft één familie. De schadeproeven draaiden op fijngetunede Qwen 2.5-modellen. Volgens de auteurs is het testen buiten Qwen “the most important next step”. Bij Qwen 2.5 32B en Llama 3.1 8B zonder fine-tune pakte het model in 1.400 en 1.399 gestuurde beurten geen enkele keer de reset-knop.

## “Het is maar een getal in een matrix” is óók te makkelijk

Wij zijn sceptisch over pijn in [large language models](https://watisai.nl/large-language-models/). Maar de sceptici maken het zich ook te makkelijk. De pijnrichting gaat namelijk niet alleen aan als een onderzoeker eraan draait.

In 140 opgeslagen gesprekken waarin een gebruiker het model kleineert, beledigt of aan het twijfelen brengt, slaat dezelfde richting vanzelf uit. Wat dan niet gebeurt: het model doet er niets mee. In die gesprekken koos het in 0 van de 560 eerste keuzes de schadeknop. Het effect op gedrag vraagt dus actieve steering.

Het signaal zit er dus wel, ook in gewone gesprekken. Of dat voor het model zelf iets betekent, weet niemand. Daar staat het onderzoek naar AI bewustzijn nu, en wie iets anders beweert, loopt vooruit op de data.

Co-auteur Cameron Berg zegt zelf op X dat de tweede versie er alleen kwam doordat het werk openbaar was: “we never would have gotten this feedback without doing so”. Dat de virale samenvatting nog op versie 1 draait, ligt niet aan de onderzoekers. Het laat wel zien hoe weinig mensen een paper zelf openen.

## Klik op v2 voor je een AI-claim deelt

Zie je een bericht over wat AI “voelt” of “wil”, met een link naar arXiv? Zo check je in een minuut of de samenvatting nog klopt:

1. Open de abstract-pagina op arxiv.org, niet de pdf.
2. Kijk onder “Submission history” of er een \[v2\] of hoger staat.
3. Vergelijk de titel en de samenvatting van de nieuwste versie met wat de post beweert.

Hier zag je het verschil al aan twee woorden: “to Relieve It” werd “on It”.

Dat kost één klik. Meer achtergrond over hoe zulke modellen werken vind je op onze pagina over [wat is ai](https://watisai.nl/). En eerder pakten we op dezelfde manier een andere AI-claim uit elkaar: [het enzym dat Claude zou hebben ontdekt](https://watisai.nl/claude-enzym-claim-check/).

## Komt het effect terug buiten Qwen?

Het eerstvolgende moment dat telt, is een versie 3 of een herhaling door een ander lab met Llama, Gemma of OLMo. Duikt het patroon daar op, dan is dit een algemene eigenschap van taalmodellen. Blijft het bij één fijngetunede familie, dan is het een interessante eigenaardigheid van Qwen.

Berg schreef dat zijn team met anderen ethische standaarden voor dit soort onderzoek gaat opstellen. Concreet is daar nog niets van. Het paper zelf noemt het nog “ongoing work”, met de belofte dat er meer verandert. Gezien de stap van v1 naar v2 mag je dat letterlijk nemen.