2026年09月03日 朝のAIニュースまとめ
(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。
(ほぼ)毎日AIニュースが届きます
ぜひご登録ください
Gemini 3.8 Flashのリリースとgpt-6-astraの動向
Googleから「Gemini 3.8 Flash」が正式にリリースされ、コーディングやエージェントタスクでの性能向上が報告されています。
また、Metaの「Muse Spark 1.3」がベンチマークで首位を獲得したほか、OpenAIのAPI上で次期モデル「gpt-6-astra」の存在が確認されました。
本日の主要なトピックを順番にご紹介します。
目次
- Gemini 3.8 FlashとCyberが正式リリース【続報】
- Muse Spark 1.3がDeepSWEで首位獲得【続報】
- OpenAI API上で「gpt-6-astra」が確認【続報】
- CrowdStrikeとOpenAIが提携拡大、AIエージェントを保護
- ByteDance Seedが自己進化型エージェントハーネス論文を発表
- コーディング向けローカルLLM勉強会の資料が公開
- Anthropicが学生向けClaudeアンバサダーを募集開始
- Kaggle AI Agent Securityコンペ解法共有【続報】
Gemini 3.8 FlashとCyberが正式リリース【続報】
- Googleの「Gemini 3.8 Flash」に関する続報です
- 同モデルおよびセキュリティ特化の「Gemini 3.8 Flash Cyber」が正式にリリースされました
- 3.7 Flashからわずか数週間でのリリースとなり、コーディングやエージェントタスク、マルチステップ推論で大幅な性能向上を達成しています
- 価格は据え置きで、Terminal-Bench 2.1やDeepSWEなどのベンチマークで高評価を得ています
- 一方で、一部からトークン効率の悪化を指摘する声も上がっています
Google DeepMind: (翻訳) AIエージェントの拡張とコードの保護を支援する2つの新しいGeminiモデルが登場しました:🔘 3.8 Flash:ソフトウェアエンジニアリング、エージェントタスク、マルチステップ推論において3.7 Flashから大幅な向上を遂げた、これまでで最もインテリジェントなモデル。🔘 3.8 Flash Cyber:最も有能な...
Rohan Paul: (翻訳) Gemini 3.8 Flashがリリースされました。いくつかの非常に重要なベンチマークでClaude Opus 5を上回っています。- HLE-Verifiedで54.9%(Claude Opus 5は54.4%)- エージェントが実際にターミナルを操作し、難しいコーディング、セキュリティ、MLを正常に完了できるかをテストするTerminal-Bench 2.1...
Haider.: (翻訳) Gemini 3.8 Flashは、長期的なソフトウェアエンジニアリングタスクでモデルをテストするDeepSWEでトップに並びました。3.8 Flash: 74% — 143k出力トークン、3.7 Flash: 65% — 107k出力トークン。しかし、トークン効率は悪そうです。3.7 Flashの1.34倍の出力トークンを使用しています。
Muse Spark 1.3がDeepSWEで首位獲得【続報】
- Metaのコーディングモデル「Muse Spark」に関する続報です
- コーディングとエージェントタスクに特化した新モデル「Muse Spark 1.3」がリリースされました
- DeepSWEベンチマークでClaude Fable 5.1やGPT-5.6 Solを上回り、首位を獲得しています
- 非常に低コストで提供されており、近日中にオープンウェイト版や次期大型モデル「Watermelon」の公開も予定されています
Evan: (翻訳) META PLATFORMS $META のCEO、マーク・ザッカーバーグが投稿しました:「Muse Spark 1.3が本日展開されます。メーターで測れないほど安価でフロンティアレベルのパフォーマンスを提供します。これはコーディングとエージェント作業において、私たちがこれまでで最大の飛躍を遂げたものです。」
🚨 AI News | TestingCatalog: (翻訳) META 🔥: Muse Spark 1.3が正式に発表され、DeepSWE 1.1でGPT-5.6やOpus 5を上回るスコアを出しました! > Muse Spark 1.3はMetaモデルAPIで展開中です。 > Metaの次の大規模モデルアップグレード「Watermelon」と、Muse Sparkのオープンウェイト版も近日公開予定です!
Rihard Jarc: (翻訳) $META のMuse Spark 1.3は、Fable 5やGPT-5.6 Solを抑えてDeepSWEで1位を獲得しました。しかもこれはまだWatermelonですらありません。$META の軌道は本当に素晴らしいです。
OpenAI API上で「gpt-6-astra」が確認【続報】
- OpenAIの次期モデル「Astra」に関する続報です
- 同社のAPI上で「gpt-6-astra」というモデル名が登録されていることが新たに確認されました
- 既報の新しい推論アプローチの採用と合わせ、単なる改良版ではなくAIの新たな段階を示すモデルになるのではないかと開発者の間で期待が高まっています
Chubby♨️: (翻訳) OpenAIの次の主要モデルAstraは、実際にはGPT-6かもしれません。「gpt-6-astra」という名前は現在、既知のOpenAI内部モデルと同じ異常なAPIレスポンスを返していますが、ランダムなモデル名は異なる形で拒否されます。これはAstraがすでにOpenAIのシステムに登録されていることを強く示唆しています。
Haider.: (翻訳) Astraは本当に「これこそがそのモデルだ」と感じさせます。人々がこれが単なる「より良いChatGPT」ではないと気づくポイントです。これまでのすべてがその方向を示しています:> 10の数学/CSの研究レベルの進歩 > OpenAI内部のAI研究インターンベンチマークを達成 > 彼らの最もアライメントされたモデル
The Information: (翻訳) OpenAIの次期モデルAstraは、研究者による監視を困難にする可能性があります。「Astraのように、このループ技術の要素を使用しているモデルは、思考の連鎖を書き出す可能性が低くなるかもしれません」「研究者にとってはより困難になるでしょう」
CrowdStrikeとOpenAIが提携拡大、AIエージェントを保護
- セキュリティ企業のCrowdStrikeとOpenAIがパートナーシップを拡大し、エージェント時代のセキュリティ強化に乗り出しました
- CrowdStrikeのAI検知・対応製品であるFalcon Guardianが、ランタイムでCodexエージェントのアクティビティを制御できるようになります
- これにより、組織はAIエージェントの動作をリアルタイムでインベントリ化し、安全に運用することが可能になります
Evan: (翻訳) CROWDSTRIKE $CRWD とOPENAIがパートナーシップを拡大し、エージェント時代を保護
Evan: (翻訳) CROWDSTRIKEとOPENAIは、CODEX AIエージェントを保護し、GPT-5.6 CYBERをFALCONプラットフォームに導入するためにパートナーシップを拡大しました。CrowdStrikeのAI検知・対応製品であるFalcon Guardianは、ランタイムでCodexエージェントのアクティビティを制御し、「組織にライブインベントリを提供します」
ByteDance Seedが自己進化型エージェントハーネス論文を発表
- ByteDance Seedの研究チームが、自己進化型エージェントハーネスに関する新しい論文「HarnessDev」を発表しました
- エージェントが完了したタスクではなく、エージェント自身が構築したハーネス(実行環境やツール群)を評価・スコア付けする新しい手法を提案しています
- AIエージェントの自律的な進化を促すアプローチとして、多くのAIエンジニアから注目を集めています
elvis: (翻訳) ByteDance Seedからの素晴らしい論文。自己進化型エージェントハーネスに興味があるなら、これは時間を割く価値があります。(ブックマーク推奨)提案されている手法「HarnessDev」は、モデルが完了したタスクでスコアを付けるのをやめ、モデルが構築したハーネスでスコアを付けます。エージェントは...
elvis: (翻訳) メタハーネスは魅力的です。AIエンジニアなら注目すべきです。異なる問題設定ですが、正しく行えばとてつもなく強力です。より良いトークン効率、オーケストレーション、ルーティング、新しいテスト時コンピュートスケーリングなどの創発的特性に興味があります...
コーディング向けローカルLLM勉強会の資料が公開
- LINEヤフー紀尾井町オフィスで開催された「コーディングのためのローカルLLM勉強会」の登壇資料が公開されました
- 松尾研究所によるLLMの学習・推論コストを品質を落とさずに削減する方法や、コーディングのためのローカルLLM基礎知識などが共有されています
- VRAM不足やレイテンシに悩むLLMエンジニアにとって非常に有用な知見がまとまっています
na0: 今日はこれに参加
からあげ: メモ
からあげ: メモ
Anthropicが学生向けClaudeアンバサダーを募集開始
- Anthropicが、学生向けの「Claude Campus Ambassadors」プログラムの募集を開始しました
- 学部生、大学院生、ポスドクの3つのトラックが用意されており、大学内でClaudeのコミュニティ形成やイベント開催を担います
- プログラム期間は2026年9月から2027年6月までで、参加する学生には年間3,600ドルの奨学金が支給されます
Claude: (翻訳) Claude Campus Ambassadorsプログラムの応募受付を開始しました。今年はより多くの学生に機会を拡大し、学部生、大学院生、博士課程/ポスドク向けの3つのトラックを用意しています。応募はこちら:
Oikon | Claude Code深掘りガイド: 【学生向け】 Claude Campus Ambassadorsプログラムの応募が開始。大学でClaudeのコミュニティを作ったり、イベントを開いたりして広めてくれる学生を募集。 ・奨学金:学年を通して 3,600ドル(約54万円前後、プログラム条件による) ・期間:2026年9月〜2027年6月
Kaggle AI Agent Securityコンペ解法共有【続報】
- Kaggleの「AI Agent Security」コンペティションに関する続報です
- ソリューション共有会が開催され、参加者から様々な解法が公開されました
- 特定のリスクヘッジ戦略で銀メダルを獲得した事例などが報告されています
- 上位陣の解法では「email.send」を一本化するアプローチなどが共有され、コンペの裏側やテクニックが議論されています
t.toda: Kaggle「AI Agent Security」コンペ | ソリューション共有会 に参加を申し込みました! https://t.co/8pI12umigP
t.toda: https://t.co/ZFz5DEl3rQ 解法上げた 久しぶりに書いたが今普通のTopicと別なんだな ざっくりいうと絶対安全だと踏んでいたemail.send 一本 ちなみにPublicはトークンを削るだけの作業だったがTopの140台はどう頑張っても届かなかったのでカラクリを知りたい
Plat 🖼️: Kaggle の AI Agent Security (全然エージェントじゃない) Multi-Step Tool Attacks (全然マルチステップではない) のコンペ、二ヶ月くらい前に飽きてしばらく放置してたけど、リスクヘッジのおかげで銀メダルになりそう