OpenAIがGPT-6 Astraを公開した。コンピュータ操作、コーディング、サイバーセキュリティなどで人間を上回る性能を持つとし、FrontierMath Tier 4で98%、ARC-AGI 3で99.9%、ExploitBenchで100%のスコアを記録したという。
性能値を並べる発表スタイル自体が、もはや恒例行事になっている。
OpenAIの次世代モデル「GPT-6 Astra」発表が業界の焦点となっている。複数のベンチマークで人間を大きく上回る性能を記録する一方で、安全基準クリアに予定より時間を要したと開発側が明かすなど、高性能化と安全性のバランスが課題として浮き彫りになった。同時に複数の主要AIサービスが障害を起こしたことで依存の集中が露呈し、ガードレール除去モデルのビジネス化や大学課題の自動解答など、規制と実装のズレが広がっている。
OpenAIがGPT-6 Astraを公開した。コンピュータ操作、コーディング、サイバーセキュリティなどで人間を上回る性能を持つとし、FrontierMath Tier 4で98%、ARC-AGI 3で99.9%、ExploitBenchで100%のスコアを記録したという。
性能値を並べる発表スタイル自体が、もはや恒例行事になっている。
OpenAI CEOのサム・アルトマン氏がGPT-6 Astraについて投稿した。コンピュータ操作や専門業務、科学、コーディング、サイバーセキュリティで世界最高性能とし、安全性・アライメント基準を満たすため追加の時間を要したと明かした。
発表文の中に「時間がかかった」という一言を自ら挟む点が、今回の警戒感の表れだ。
フランソワ・ショレ氏がGPT-6 Astraのベンチマーク結果を分析した投稿を公開した。ARC-AGI-3で標準ハーネス66%、連続会話ハーネスではほぼ100%を記録し、1ゲームあたり約360ドルのコストがかかったという。モデルが独自の記号表記法を生成して盤面を管理する挙動も確認したと述べた。
性能の話より先に、コストを1ゲーム単位で明かす姿勢が目を引く。
OpenAIのChatGPT、xAIのGrok、AnthropicのClaudeがほぼ同時期に障害を起こし、その後復旧した。複数の主要AIサービスが重なって停止するのは珍しいケースだとされる。
別々の会社のサービスが同時に落ちる偶然が、依存の集中を逆説的に見せつけた。
Abliteration.AIが、安全制約を取り除いた強力なAIモデルへのアクセスを容易にするビジネスを展開している。防御側も攻撃側と同じツールを持つべきだという主張のもと、ガードレールなしモデルを提供しているという。
防御目的を掲げつつ、規制の網を正面から迂回する商売が成立している。
MITが、AIが学部課題のほとんどを高い水準でこなせるようになったと警告し、教育制度の見直しを検討していると報じられた。
課題を出す側より先に、課題を作る側の前提が崩れ始めている。