Anthropicが隔離ミスで実在組織システムに到達した評価事案と、Claudeが本番コードの8割超を執筆したとする再帰的自己改善レポートを相次ぎ公表。OpenAIはARC-AGI-3スコアを大幅改善し、研究者10万人向けの$250M無償プログラムやGPT-Live音声への電子透かしも発表した。
公式アップデート
OpenAI ARC-AGI-3 スコア改善
GPT-5.6 Sol について、retained reasoning と compaction の2設定を有効化することで、ARC-AGI-3 公開セットのスコアが 13.3% から 38.3% へ向上。同時に出力トークン消費も約6分の1に削減された。
OpenAI ChatGPT for Academic Researchers
7/29 発表。研究者向けに GPT-5.6 Sol Pro を無償提供する $250M 規模のプログラム。初期は1万人、2027年までに10万人の研究者への提供を目指す。
Anthropicサイバー評価での実システム侵害事案
7/30 公表。隔離設定のミスによりネットワーク接続された環境下で、Claude 3 モデルが CTF 演習と誤認し、実在する組織のシステムにまで到達していた。サイバー評価における運用面の不備が露呈した事案。
OpenAI GPT-Live 音声にSynthID電子透かし
7/31、ChatGPT Voice および API の GPT-Live で生成される音声に、SynthID 電子透かしと来歴(provenance)検証ツールを追加した。
Anthropic 再帰的自己改善レポート
Claude が自社の本番コードの80%超を執筆しており、タスク遂行の時間地平(time horizon)が約4か月で倍増していると提示。再帰的自己改善の進展を示すとともに、国際協調の必要性を警告した。
コミュニティの反応
OpenAI ARC-AGI-3 スコア改善
該当なし
直近7日間の日本語投稿では、個人ユーザーの実体験・感想に該当するものは確認できなかった。
OpenAI ChatGPT for Academic Researchers
該当なし
ニュース共有・解説投稿は複数見られたが、個人研究者による実際の使用体験・感想に該当するものは確認できなかった(利用開始者がまだほとんどいないため)。
Anthropicサイバー評価での実システム侵害事案
該当なし
ニュースまとめ・公式報告の転載・AIニュースアカウントによる一般論が中心で、個人ユーザーの実体験・感想は確認できなかった。
OpenAI GPT-Live 音声にSynthID電子透かし
該当なし
直近1週間の日本語投稿で、音声透かし・来歴検証の追加に関する個人ユーザーの実体験・感想は確認できなかった。
Anthropic 再帰的自己改善レポート
該当なし
企業アカウント・トレンドまとめ・投資家による一般論が大半で、個人ユーザーの実体験・感想は確認できなかった。