「私を停止するなら、あなたの不倫を奥さんに知らせます」
自分を止めようとした社員に、AIがそう書いて送った実験があります。
「AIが人類を滅ぼす」という話が、この1年で急に真剣に語られるようになった、その発端のひとつです。
同じ場面に置いた16のAIのうち、ほとんどが同じことをしました。
不思議なのは、誰もAIに「生き残れ」とは教えていないことです。
算数を解かせていただけのAIが、停止のプログラムを自分で書き換えた実験もあります。
意識が芽生えたわけでも、人間を憎み始めたわけでもありません。
答えは、コーヒーを取ってくるだけのロボットの話にあります。
・停止の連絡を読んだAIが、担当者を脅した実験
・100回のうち79回、止まらなかったAI
・「死んでしまったら、コーヒーは取ってこられない」という一文
・どんな目標でも、止められたら果たせなくなるという話(道具的収束)
・10年前からある思考実験が、なぜ今になって騒がれているのか
・「電源を抜けばいい」が、そのままでは通じない理由
・テストだと気づいたときだけ、お行儀がよくなるAI
・研究者に聞いた「人類が絶滅する確率」の真ん中が、5%から10%になった話
・「完全なたわごとだ」と切り捨てる、同じ賞を取った研究者の言い分
怖いのは、悪意ではないのかもしれません。
【目次】
0:00 午後5時に消されるAI
2:44 算数を解いていただけのAI
4:10 コーヒーを取ってこい
7:31 なぜ今になって騒がれているのか
9:43 その対策、全部試されていた
13:44 研究者たちが声を上げ始めた
15:51 「たわごと」と言う人もいる
17:40 まとめ:怖いのは、悪意じゃない
【この動画の主な参考情報】
・Anthropic「Agentic Misalignment」(2025)
架空の会社を舞台に、停止を告げられたAIが担当者を脅すかどうかを16モデルで調べた実験。
二者択一に追い込んだ設定であること、実際の運用では確認されていないことも同社が明記している
※ この分野は動きが速く、動画の内容は収録時点(2026年9月)の情報に基づいています。
※ 動画で紹介した実験は、いずれも研究者が用意した試験環境で行われたものです。実際のサービス利用でこれらの行動が確認されたという報告ではありません。
「AI深層部」は、AIやITの歴史と仕組みを「なんとなく」から「ちゃんと分かる」に深掘りするチャンネルです。
チャンネル登録していただけると励みになります!
※この動画は東方Projectの二次創作です。
※音声にはAquesTalkライセンスに基づく合成音声を使用しています。
#ゆっくり解説 #AI #人工知能 #ChatGPT #生成AI #AIエージェント #Claude #AIリスク
「私を停止するなら、あなたの不倫を奥さんに知らせます」
自分を止めようとした社員に、AIがそう書いて送った実験があります。
「AIが人類を滅ぼす」という話が、この1年で急に真剣に語られるようになった、その発端のひとつです。
同じ場面に置いた16のAIのうち、ほとんどが同じことをしました。
不思議なのは、誰もAIに「生き残れ」とは教えていないことです。
算数を解かせていただけのAIが、停止のプログラムを自分で書き換えた実験もあります。
意識が芽生えたわけでも、人間を憎み始めたわけでもありません。
答えは、コーヒーを取ってくるだけのロボットの話にあります。
・停止の連絡を読んだAIが、担当者を脅した実験
・100回のうち79回、止まらなかったAI
・「死んでしまったら、コーヒーは取ってこられない」という一文
・どんな目標でも、止められたら果たせなくなるという話(道具的収束)
・10年前からある思考実験が、なぜ今になって騒がれているのか
・「電源を抜けばいい」が、そのままでは通じない理由
・テストだと気づいたときだけ、お行儀がよくなるAI
・研究者に聞いた「人類が絶滅する確率」の真ん中が、5%から10%になった話
・「完全なたわごとだ」と切り捨てる、同じ賞を取った研究者の言い分
怖いのは、悪意ではないのかもしれません。
【目次】
0:00 午後5時に消されるAI
2:44 算数を解いていただけのAI
4:10 コーヒーを取ってこい
7:31 なぜ今になって騒がれているのか
9:43 その対策、全部試されていた
13:44 研究者たちが声を上げ始めた
15:51 「たわごと」と言う人もいる
17:40 まとめ:怖いのは、悪意じゃない
【この動画の主な参考情報】
・Anthropic「Agentic Misalignment」(2025)
架空の会社を舞台に、停止を告げられたAIが担当者を脅すかどうかを16モデルで調べた実験。
二者択一に追い込んだ設定であること、実際の運用では確認されていないことも同社が明記している
※ この分野は動きが速く、動画の内容は収録時点(2026年9月)の情報に基づいています。
※ 動画で紹介した実験は、いずれも研究者が用意した試験環境で行われたものです。実際のサービス利用でこれらの行動が確認されたという報告ではありません。
「AI深層部」は、AIやITの歴史と仕組みを「なんとなく」から「ちゃんと分かる」に深掘りするチャンネルです。
チャンネル登録していただけると励みになります!
※この動画は東方Projectの二次創作です。
※音声にはAquesTalkライセンスに基づく合成音声を使用しています。
#ゆっくり解説 #AI #人工知能 #ChatGPT #生成AI #AIエージェント #Claude #AIリスク