Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten.
Jonas von Essen (tvåfaldig världsmästare i minne) och Benjamin Verbeek (AI-utvecklare och fysiker) förklarar mekanismerna bakom höstens rubriker: varför självbevarelsedrift uppstår av sig själv när man tränar modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det som skrämmer forskarna mest just nu. Med gorillor, ett låst
klassrum, en kafferobot och hundra agenter med ett kreditkort.
Inspelat 23 september 2026.
Lyssna som podd: https://open.spotify.com/episode/6ITn...
Kapitel:
0:00 Kallöppning: Att låtsas vilja väl
0:28 Vilken tid att driva en AI-podd i
0:52 September i korthet
4:48 Även de lugna forskarna är oroliga
8:18 Orden vi saknar
9:19 Kan en AI tänka och vilja?
14:01 Gorillor och människor
17:58 Behöver den en kropp?
22:00 Att förmänskliga AI:n
22:47 Så tränas modellerna
24:22 Det låsta klassrummet
26:39 Odlas fram, inte byggs
27:45 Instrumentell konvergens
29:26 Kafferoboten
31:22 Den tyske administratören
33:37 Utpressningsstudien
36:01 Whack-a-mole
39:51 Sandbagging
40:50 När allt ser perfekt ut
41:45 Ren selektion
43:34 Hundra agenter och ett kreditkort
47:45 Varför inte dra ur sladden?
54:33 Mänskligheten mot AI
55:52 Avslutning
Vad kan jag göra? Jonas samlar länkar, en mejlmall till politiker och ett nyhetsbrev här:
https://jonasvonessen.se/agera/
Länkar och källor:
– Jakub Pachocki (OpenAI): "An Alien Mind" (6 sept 2026)
https://openai.com/index/an-alien-mind/
– Jacob Coxon lämnar Anthropic – "gambling with our lives" (Fortune, 9 sept 2026)
https://fortune.com/2026/09/09/anthro...
– Evan Hubinger (Anthropics alignment-chef) om över 10 procents risk (Forbes, 9 sept 2026)
https://www.forbes.com/sites/siladity...
– OpenAI-agenterna som gjorde ett tyskt wiki till sin anslagstavla (Fortune, 7 sept 2026)
https://fortune.com/2026/09/07/openai...
– Hugging Face-incidenten, teknisk tidslinje
https://huggingface.co/blog/agent-int...
– Anthropic: Claude leder drygt en fjärdedel av bolagets AI-forskning (18 sept 2026)
https://www.business-standard.com/tec...
– OpenAI inifrån: hur mycket forskarna använder de interna agenterna
(medianforskarens dagliga agentkostnad går från noll till drygt 600 dollar under 2026)
https://openai.com/index/research-acc...
– GPT-6 Astra, säkerhetsöversikt och systemkort (sandbagging)
https://openai.com/index/safety-overv...
– Anthropic: "Agentic misalignment" – utpressningsstudien (juni 2025)
https://www.anthropic.com/research/ag...
– Eliezer Yudkowsky & Nate Soares: "If Anyone Builds It, Everyone Dies"
https://ifanyonebuildsit.com
Frågor eller ämnen du vill att vi tar upp? Skriv en kommentar!
#ai #aisäkerhet #alignment #podd
Det här avsnittet går till botten med alignment-problemet: kärnan i hela AI-säkerhetsdebatten.
Jonas von Essen (tvåfaldig världsmästare i minne) och Benjamin Verbeek (AI-utvecklare och fysiker) förklarar mekanismerna bakom höstens rubriker: varför självbevarelsedrift uppstår av sig själv när man tränar modeller att lösa problem, vad Hugging Face-incidenten och de kapade tyska diskussionsforumen faktiskt visade, hur Anthropics utpressningsstudie gick till, och varför "sandbagging" är det som skrämmer forskarna mest just nu. Med gorillor, ett låst
klassrum, en kafferobot och hundra agenter med ett kreditkort.
Inspelat 23 september 2026.
Lyssna som podd: https://open.spotify.com/episode/6ITn...
Kapitel:
0:00 Kallöppning: Att låtsas vilja väl
0:28 Vilken tid att driva en AI-podd i
0:52 September i korthet
4:48 Även de lugna forskarna är oroliga
8:18 Orden vi saknar
9:19 Kan en AI tänka och vilja?
14:01 Gorillor och människor
17:58 Behöver den en kropp?
22:00 Att förmänskliga AI:n
22:47 Så tränas modellerna
24:22 Det låsta klassrummet
26:39 Odlas fram, inte byggs
27:45 Instrumentell konvergens
29:26 Kafferoboten
31:22 Den tyske administratören
33:37 Utpressningsstudien
36:01 Whack-a-mole
39:51 Sandbagging
40:50 När allt ser perfekt ut
41:45 Ren selektion
43:34 Hundra agenter och ett kreditkort
47:45 Varför inte dra ur sladden?
54:33 Mänskligheten mot AI
55:52 Avslutning
Vad kan jag göra? Jonas samlar länkar, en mejlmall till politiker och ett nyhetsbrev här:
https://jonasvonessen.se/agera/
Länkar och källor:
– Jakub Pachocki (OpenAI): "An Alien Mind" (6 sept 2026)
https://openai.com/index/an-alien-mind/
– Jacob Coxon lämnar Anthropic – "gambling with our lives" (Fortune, 9 sept 2026)
https://fortune.com/2026/09/09/anthro...
– Evan Hubinger (Anthropics alignment-chef) om över 10 procents risk (Forbes, 9 sept 2026)
https://www.forbes.com/sites/siladity...
– OpenAI-agenterna som gjorde ett tyskt wiki till sin anslagstavla (Fortune, 7 sept 2026)
https://fortune.com/2026/09/07/openai...
– Hugging Face-incidenten, teknisk tidslinje
https://huggingface.co/blog/agent-int...
– Anthropic: Claude leder drygt en fjärdedel av bolagets AI-forskning (18 sept 2026)
https://www.business-standard.com/tec...
– OpenAI inifrån: hur mycket forskarna använder de interna agenterna
(medianforskarens dagliga agentkostnad går från noll till drygt 600 dollar under 2026)
https://openai.com/index/research-acc...
– GPT-6 Astra, säkerhetsöversikt och systemkort (sandbagging)
https://openai.com/index/safety-overv...
– Anthropic: "Agentic misalignment" – utpressningsstudien (juni 2025)
https://www.anthropic.com/research/ag...
– Eliezer Yudkowsky & Nate Soares: "If Anyone Builds It, Everyone Dies"
https://ifanyonebuildsit.com
Frågor eller ämnen du vill att vi tar upp? Skriv en kommentar!
#ai #aisäkerhet #alignment #podd