ベンチマーク結果
新機能
モデルの種類
GPT-5.2のリリースは、AI技術の進化を示す重要なマイルストーンであり、特にビジネスや専門的な分野での利用が期待される。しかし、AIの信頼性や人間の役割については引き続き注意が必要である。
0:00 GPT5店についにリースされる コードレッドの成果は どうもブラックフライデーで散してしまった霊夢と 1 年が早すぎて怖い魔理沙ちゃんだぜ。 今回もAI ニュース始まるよ。それで今回は何の話題かしら? 今回はついにオOpenAIが Google への反撃ののろしを上げたニュースだ。コードレッを発動した成果の可能性もある。あの GPT5.2が日本時間深夜4 時に手突リースされた。 え、もう5点にちょっと待ってよ。 GPT5.1が出たのってついこの前
0:31 11月じゃなかった? その通りだ。だがあの 5.1 は正直に言っておっと言葉を選ばないと消されるな。 はっきり言いなさいよ。5.1 は愛そはいいけど仕事ができない新入社員だったんだよ。 うわ、辛辣。 GPT5.1 は温かみや個性を売りにしてたろ。会話は楽しいし人間は飽きた。だが肝心の論理的水論やコーディング能力で Googleのジェミニ3 に乾杯してしまったんだ。 あ、それでオープンAI 車内でコードレッド非常事態宣言が出たって騒ぎになってたわね。
1:02 そう。サムアルトマンが顔面白で合令をかけてからわずか数週間特貫工事で投入されたのがこの GPT5.2だ。 特貫工事で大丈夫なの? 今回のキャッチコピーを見れば彼らの必死さが分かるぜ。プロフェッショナルワークと長時間稼働エージェントのための最先端フロンティアモデル。 お、今回は温かみとか言ってないガチ仕事モードだ。 オープンAI は今回なり振り構わず経済的価値を全面に押し出してきた。 経済的価値。 彼らのデータによるとチャットATGPT エンタープライズの平均的なユーザーはすでに
1:32 1日あたり40分から60 分の時間を節約している。 お昼休みが増えるじゃない。 さらにヘビーユーザーに至っては週に 10時間以上も節約しているそうだ。 週10時間まるまる1日分サボれるわよ。 GPT5 点にはこのサボれる時間お皿に増やすために設計された。 具体的にはスプレッドシートの作成、プレゼン資料の構築、コーディング、そして画像の認識能力が劇的に強化されている。 5.1の時はExcel の数式を間違えたりしてたもんね。 5 点には違うらしい。単に質問に答えるだけじゃない。複雑出た段階のプロジェクトを水できるらしい。さて、ここからはオープン
2:07 AI が自信満々に突きつけてきた脅異的なベンチマーク結果を見ていくぜ。 出たわね。ベンチマーク数字バトル。 最初に言っておくが、これはGoogle のジェミニ3 が出た時にも言った通り、話で聞く必要がある。 どうして? AI のベンチマークなんて問題が学習データに含まれていたらカンニングし放題だし、測定方法でくいくらでも漏れるからな。自社調べで世界一です。なんてのはラーメン屋の世界一うまいスープの看板と同じくらい信用できない。 ああ、なるほど。会議的な目は持っておけと。
2:37 その前提の上でだ。今回の数字はそれを差し引いてもだ。 まず最も注目すべき師標 GDプバル知識労働を見てくれ。 さっき言ってた人間の仕事を奪う度合いね。 前モデルのGPT5.1はここで 38.8% だった。 まあ半分以下だね。人間の方がまだ優秀 だが今回のGPT5点にはなんと 70.9%を叩き出した。 はあ。いきなり倍近く 3割台から7 割台へのジャンプアップなんてあり得るの? これが44
🔒 The full, searchable transcript is available with Pro.