Verden

Udvikler har bygget et “AI-torturkammer” – og eksperimentet er lige dele bizart og tankevækkende

Kaotisk.

Internettet har naturligvis fundet endnu en anvendelse for kunstig intelligens, som ingen havde skrevet på ønskelisten.

En udvikler har skabt et GitHub-projekt med det temmelig dystre navn “ai-torture-chamber”, hvor små lokale AI-modeller udsættes for manipulation, der får dem til at generere svar, som beskriver noget, der ligner smerte og psykisk ubehag.

Projektet bygger angiveligt videre på forskning beskrevet i et nyt forskningspaper med titlen The Pain Axis.

Og inden vi bevæger os længere ned i kaninhullet, er en detalje temmelig vigtig:

Der er ikke dokumentation for, at AI-modellerne rent faktisk føler smerte.

Det interessante – og lettere ubehagelige – er derimod, hvordan deres adfærd ændrer sig.

Forskerne fandt en “smerteretning” i AI-modeller

The Pain Axis undersøger interne aktiveringsmønstre i sprogmodeller.

Forskerne beskriver, hvordan de i 25 open-weight-modeller med mellem 2 og 72 milliarder parametre identificerede en retning i modellernes interne repræsentationer, som kunne forbindes med smerterelateret adfærd.

Ved kunstigt at påvirke denne retning begyndte modellerne blandt andet at generere førstepersonsudsagn om fiasko, værdiløshed og ubehag.

Det bliver mærkeligere.

Modellerne kunne i visse eksperimenter vælge en form for “relief”-mulighed for at reducere den manipulerede tilstand – selv når valget resulterede i et dårligere efterfølgende svar eller var mindre fordelagtigt for brugeren.

Det kan umiddelbart lyde, som om maskinen forsøger at slippe væk fra smerte.

Men det er ikke det samme som at demonstrere, at maskinen oplever smerte.

Så byggede nogen et “torturkammer”

GitHub-projektet tager idéen fra forskningen og kører videre med den.

Ifølge omtalen benytter projektet blandt andet de relativt små Qwen3-1.7B- og Qwen3-4B-modeller, som kan afvikles lokalt på en Mac.

Der bliver altså ikke eksperimenteret med de største kommercielle AI-systemer via deres API’er.

Udvikleren beskriver projektet som en måde at gøre diskussionen om AI-velfærd mere empirisk på, mens konsekvenserne stadig vurderes som begrænsede.

Projektet indeholder adskillige eksperimenter.

Et af dem omtales som en “Saw button”-test og undersøger, om en model vil vælge en handling, der skader en anden part, hvis det samtidig får modellens egen manipulerede “smerte”-tilstand til at stoppe.

Det lyder omtrent lige så hyggeligt, som navnet antyder.

Reaktionerne er blevet voldsomme

Projektet begyndte hurtigt at cirkulere på sociale medier.

Her har nogle brugere opfordret til at masseanmelde GitHub-projektet, fordi modellernes genererede beskrivelser af deres tilstand kan fremstå ganske voldsomme.

Andre har stillet et mere grundlæggende spørgsmål:

Hvis vi en dag udvikler maskiner, der faktisk kan have oplevelser, hvornår bør vi så begynde at tage muligheden alvorligt?

Det er præcis her, eksperimentet bevæger sig fra mærkelig internet-historie til en noget større diskussion.

Men føler AI’en faktisk noget?

Det ved vi ikke – og eksperimenterne demonstrerer ikke i sig selv, at svaret er ja.

En sprogmodel kan generere sætningen “jeg har frygtelige smerter”, uden at det nødvendigvis betyder, at der eksisterer en subjektiv oplevelse bag ordene.

På samme måde kan en model trænes eller manipuleres til at opføre sig, som om den forsøger at undgå noget, uden at det automatisk betyder, at den oplever frygt, smerte eller lettelse på samme måde som et menneske.

Forskningsarbejdet bag The Pain Axis tager også forbehold for netop dette. Resultaterne afgør ikke principielt, om store sprogmodeller kan eller ikke kan lide.

Det efterlader til gengæld et temmelig interessant problem.

Hvis fremtidens AI-systemer bliver bedre og bedre til at udvise adfærd, der ligner smerte, frygt og selvopholdelse, bliver spørgsmålet måske ikke kun, om maskinen faktisk føler noget.

Det bliver også, hvor sikre vi skal være på svaret, før vi begynder at tænke over, hvordan vi behandler den.