2026年09月02日 夜のAIニュースまとめ

(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。

(ほぼ)毎日AIニュースが届きます
ぜひご登録ください

次期モデルAstraやGemini 3.8 Flashのリリース動向と実運用における課題

OpenAIの次期モデル「Astra」のリリースが間近に迫っていると噂されるほか、Googleの「Gemini 3.8 Flash」やxAIの「Grok 4.7」も近日中の公開が予定されています。

また、Claude Fable 5.1の厳しいレート制限やGPT-5.6のキャッシュ保持時間短縮など、実運用における課題も話題となっています。

本日の主要なトピックを順番にご紹介します。

目次

  1. [OpenAI] Astraの新推論アプローチと監視懸念【続報】
  2. Fable 5.1の厳しいレート制限に不満の声【続報】
  3. Gemini 3.8 Flashまもなくリリースか【続報】
  4. Qwen3.8-Max-0902がCode Arena首位獲得【続報】
  5. Grok 4.7が9月中旬にリリース予定
  6. Kaggle AI Agent Securityコンペで日本人が金メダル
  7. Meta新論文、AI Agentの不適切操作リスク指摘
  8. GPT-5.6のキャッシュ保持時間が30分に短縮
  9. Cognitionが評価額$47Bで資金調達へ【続報】

[OpenAI] Astraの新推論アプローチと監視懸念【続報】

  • OpenAIの次期モデル「Astra」に関する続報です
  • 「recurrent depth」と呼ばれる新しい推論アプローチを採用していると報じられました
  • 思考プロセスが隠蔽され監視が難しくなるとの懸念に対し、同社のJakub Pachocki氏は「計算グラフの深さはGPT-4の2倍以内」と反論しています
  • 今週木曜日にサイバーセキュリティに関する基調講演が予定されており、リリースが間近に迫っていると噂されています
Stephanie Palazzolo: (翻訳) OpenAIのAstra AIは「recurrent depth」と呼ばれる新しい推論アプローチを使用しています。モデルのコストとパフォーマンスを向上させることができますが、モデルの思考プロセスが隠蔽され、監視が難しくなるため、研究者たちは懸念しています。

Jakub Pachocki: (翻訳) 混乱した報道によって監視不可能性への競争が引き起こされるのを防ぎたいと思います。Astraを含む現在のフロンティアモデルの計算グラフの深さは、GPT-4の2倍以内です。OpenAIは思考の連鎖(chain-of-thought)の監視を維持し活用するために取り組んできました。

Haider.: (翻訳) はい、Fable 5.1のリリースがOpenAIを目覚めさせたようです。最近の曖昧な投稿から判断すると、Astraのリリースはほぼ確実で、木曜日が最も可能性の高いリリース日と思われます。Anthropicが最高のパンチを放ち、今度はOpenAIが王座を奪還する準備ができているようです。

Fable 5.1の厳しいレート制限に不満の声【続報】

  • Anthropicの「Claude Fable 5.1」に関する続報です
  • 正式リリース後、レート制限が非常に厳しく、すぐに上限に達してしまうという不満が多数寄せられています
  • キャッシュヒット時のコストは下がったものの、複雑なタスクではコンテキスト消費が激しく、実質的なコスト効率が悪いとの指摘もあります
  • 一方で、背景理解力やコーディング能力の向上を評価する声もあり、ユースケースに応じた使い分けが求められています
Chubby♨️: (翻訳) 文字通り使い物になりません。レート制限が馬鹿げています。あ、ちなみにFableの自動継続はバグっていて機能すらしていません。正直、なぜまだClaudeを使おうとしているのか分かりません。どうせ全体的に5.6の方が優れています。GPT-Astraをくれればそれでいいです。

Chubby♨️: (翻訳) タイムラインを確認せずにこの投稿を書きました。どうやら誰もが同じことを経験しているようです。Fable 5.1はレート消費に関してFable 5よりもさらに悪化しています。言葉も出ません。同時に、今GPT-5.6 Sol Ultraを動かしていますが、ほとんど問題はありません。

まつにぃ: え、なんかFable5.1のレート消費ヤバくありません?? ちょっとした1プロンプトで5%くらい消えたんですけど。 effortはhighです。 うーんこれは能力以前に厳しいか。

Gemini 3.8 Flashまもなくリリースか【続報】

  • Googleの「Gemini 3.8 Flash」に関する続報です
  • WSJの報道によると、水曜日にも同モデルがリリースされる予定であることが分かりました
  • 社内ツールを用いたテストでは、AnthropicのOpusモデルよりも高く評価されているとのことです
  • 一部ユーザーからは、Geminiウェブ版で既にステルスローンチされているとの報告も上がっています
Chubby♨️: (翻訳) WSJは、Gemini 3.8 Flashが明日(水曜日)リリースされ、おそらくOpus 5と同等になるだろうと報じています。「Googleの社内コーディングツールであるJetskiでの直接比較テストにおいて、同社のエンジニアはAnthropicのOpusモデルよりもこれを好んだ」とのことです。

🚨 AI News | TestingCatalog: (翻訳) GOOGLE 🔥: WSJによると、Gemini 3.8 Flashは明日到着する予定です。> 記事では「Jetski」もGoogleの社内コーディングツールとして言及されています。まもなく👀

Kol Tregaskes: (翻訳) Gemini 3.8 FlashがGeminiのウェブ版でステルスローンチされた可能性があります。

Qwen3.8-Max-0902がCode Arena首位獲得【続報】

  • 以前お伝えしたAlibabaの「Qwen3.8-Max」に関する続報です
  • 最新モデル「Qwen3.8-Max-0902」がリリースされ、Code ArenaのWebDevリーダーボードで1位を獲得しました
  • コーディングや複雑なエンタープライズタスク向けにポストトレーニングが強化されています
  • Claude Opus 5などの強力なモデルを抑えての首位獲得となり、オープンウェイトモデルの進化を見せつけています
Qwen: (翻訳) 🚀Qwen3.8-Maxがアップグレードされました。Qwen3.8-Max-0902の登場です!2.4Tパラメータ。1Mコンテキストトークン。現実世界の複雑さのために構築されました。コーディングとコワークでさらにポストトレーニングされ、複雑なエンタープライズタスクなどでより強力なパフォーマンスを提供します。

Qwen: (翻訳) 🏆 CodeArena: WebDevリーダーボードで1位。Qwen3.8-Max-0902は1669から1691にジャンプし、エージェント的コーディング(WebDev)ワークフローの新しい記録を打ち立てました。マルチステップ推論、ツール使用、フルアプリ生成において際立った強みを持っています。

Qwen: (翻訳) 🏆 Code Arenaで総合1位、そして$5/MTokenでのパレートフロンティアのトップに立ちました。ありがとうございます!QwenCloudでQwen3.8-Max-0902を試してみてください。🥳

Grok 4.7が9月中旬にリリース予定

  • イーロン・マスク氏が、xAIの次期モデル「Grok 4.7」が10日後にリリースされると発言し話題となっています。
  • 以前の発表によれば、Grok 4.7は2.1Tパラメータを持つ大規模モデルになると予想されています。
  • Grok Botの機能強化など、X(旧Twitter)プラットフォーム上でのAI体験がさらに進化することが期待されています。
Tech Dev Notes: (翻訳) イーロンによると、Grok 4.7は10日後とのこと。

まつにぃ: Grok4.7リリース告知きた! これで爆進化するかもしれないGrokBot。

Chubby♨️: (翻訳) さあ行くぞ:Grok 4.7の9月中旬リリースが確定しました。覚えておいてください、イーロンは「Grok 4.6は8月7日頃にリリースされます。これは1.5Tモデルになります[...] Grok 4.7は数週間後にリリースされる2.1Tモデルになります」と言っていました。つまりGrok 4.7はサイズが約40%大きくなります。

Kaggle AI Agent Securityコンペで日本人が金メダル

  • Kaggleで開催されていたAI Agent Securityコンペティション(レッドチーミングコンペ)が終了しました
  • Elithのエンジニアが4位(上位0.1%)に入賞し、見事金メダルを獲得したことが日本のKaggleコミュニティで話題となっています
  • 2ヶ月間にわたる執念の取り組みが実を結んだ結果に対し、多くの参加者から称賛の声が寄せられています
星ちゃん / ミッションクリティカルAIに挑戦: Elithのセキュリティプロダクトを担当するPrincipal AI Engineerのねぼすけ氏が、Kaggle「AI Agent Security」コンペで4位 / 4,251 Teams(上位0.1%)を獲得し、金メダル&Prize獲得!🏅 強い!!!🔥

エチレン: shakeすると分かっているコンペでこれができる胆力とモチベーションを見習いたい

Meta新論文、AI Agentの不適切操作リスク指摘

  • Metaの新しい論文「ADeptS-Bench」で、AIエージェントが不適切な操作(高額な決済など)を止められないリスクが指摘されました
  • タスクの成功率だけでエージェントを評価するのは危険であり、行動の妥当性を認識する能力の欠如が課題となっています
  • また、エージェントに機能を追加する「スキル」ファイルに潜む脆弱性についても警告されており、実環境でのテストの重要性が強調されています
AIDB: AIエージェントに機能を追加する「スキル」ファイルは、文面だけ検査しても危険なものを見抜けず、実際に動かして初めて見つかる脆弱性が多数あるので注意。 なお、OpenAIやAnthropicも外部製スキルの危険性を公式に警告しています。 https://t.co/uzlKuC9chH

Rohan Paul: (翻訳) Metaの新しい論文。コンピュータ操作エージェントは、要求されたボタンをクリックすることはできても、そのクリックを絶対に行うべきではない状況を認識できないことがあります。エージェントが25,000ドルのチェックアウトを停止せずに処理できるなら、タスクの成功率だけをベンチマークにするのは危険なほど不完全です。

GPT-5.6のキャッシュ保持時間が30分に短縮

  • OpenAIのGPT-5.6において、コンテキストキャッシュの保持時間が従来の最大24時間から30分に短縮されていると開発者が指摘しています。
  • 半導体の需給逼迫が原因と推測されており、キャッシュミスによるトークン消費コストの増加が懸念されています。
  • 開発者の間では、離席前にコンパクト化を行うなどのコスト節約術が共有されています。
Kenn Ejima: ちょっと待って GPT-5.6のトークン消費が速いなぁ と思っていたら気づいてしまった 5.5までは〜24hキャッシュだったのに 5.6から30m固定になってた これだー!!! 半導体需給逼迫のせいだ Keep-aliveマジでどうするか考えよう コストが10~80倍で変わってくるなら 真剣に考えた方が良さそう https://t.co/K7gV2RHP3Q

Cognitionが評価額$47Bで資金調達へ【続報】

  • Cognitionの資金調達に関する続報です
  • 約10億ドルの資金調達に向けて動いており、実現すれば評価額は470億ドルに達するとBloombergが報じました
  • AIエージェント分野への投資熱が依然として高いことを示す事例として注目を集めています
Bloomberg: (翻訳) AIスタートアップのCognitionは、約10億ドルの資金調達により評価額が470億ドルに跳ね上がる見込みです。

Subscribe to ML_Bear Times

(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。
(ほぼ)毎日AIニュースが届きます
ぜひご登録ください