2026年07月25日 朝のAIニュースまとめ

(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。

(ほぼ)毎日AIニュースが届きます
ぜひご登録ください

Claude Opus 5のリリースとオープンモデル支持を巡る動向

Anthropicから最高性能を誇る「Claude Opus 5」がリリースされ、高いコストパフォーマンスで注目を集めています。

また、NVIDIAのCEOらがオープンモデル支持の書簡に署名する一方、OpenAIなどは見送るなど、業界内の立場の違いが浮き彫りになりました。

本日の主要なニュースを順番に確認していきましょう。

目次

  1. AnthropicがClaude Opus 5をリリース
  2. NVIDIA CEOらがオープンモデル支持の書簡に署名
  3. ChatGPT Workがログイン必須サイトに対応【続報】
  4. Midjourneyが占星術アプリCo-Starを買収
  5. Grok 4.6/4.7のリリース計画と4.5値下げ【続報】
  6. Gemini APIでtemperature等のパラメータが非推奨に
  7. オープンウェイトの自動ルーティングモデルDariが公開
  8. Atomic AgentがGAIAベンチマークでHermesを上回る
  9. Claude 5世代向けのコンテキストエンジニアリング新ルール
  10. AIエージェントの失敗原因はコンテキスト肥大化との指摘

AnthropicがClaude Opus 5をリリース

  • Fable 5に匹敵する性能を半額で提供する「Claude Opus 5」がリリースされました。
  • ARC-AGI-3ベンチマークで30.2%を記録し、SOTA(最高性能)を達成しています。
  • トークン効率が良く、プロンプトインジェクションにも強いと評価されており、Claude Code等でも利用可能になっています。
Anthony Morris ツ: (翻訳) 週末の予定を入れていないことを祈るよ (引用ツイート: Claude Opus 5を発表します。Fable 5のフロンティアレベルの知能に迫る、思慮深くプロアクティブなモデルを半額で提供します。)

elvis: (翻訳) Claude Opus 5が登場。Fable 5の半額というのは素晴らしい!しかし、最大のニュースはトークン効率です。手頃な価格のフロンティアレベルの知能が必要なので、この方向性は気に入っています。

Alex Albert: (翻訳) Opus 5のローンチで私のお気に入りのグラフのいくつかです。知能の基準を引き上げつつ、様々なドメインでこのモデルのトークン効率を良くするために多大な労力を費やしました。非常にスムーズに使えて、多くのコーディングタスクでFable 5よりも好んで使っています。

NVIDIA CEOらがオープンモデル支持の書簡に署名

  • NVIDIAのJensen Huang CEOがXに初投稿し、オープンモデルの重要性を訴える書簡を共有しました。
  • Meta、Microsoft、Palantir、Hugging Faceなども署名しており、米国の競争力強化と安全保障の両立を主張しています。
  • 一方で、AnthropicやOpenAIはこの書簡に署名しておらず、AI業界内での立場の違いが浮き彫りになっています。
Evan: (翻訳) NVIDIAのCEO、ジェンスン・フアンがXで初めての投稿をしました 👀 (引用ツイート: 私の最初の投稿として、オープンモデルがなぜ重要なのかについてNVIDIAが署名した書簡を共有します。AIはあらゆる産業を変革し、あらゆる企業に力を与え、あらゆる国によって構築されるでしょう。オープンモデルは安全性とサイバーセキュリティを強化し、イノベーションと普及を加速させ、主権を可能にします。...

パウロ: Satya氏もオープンウェイト推進 良いモデルお願いします

Haider.: (翻訳) 大きな進展です。Nvidia、Meta、Microsoft、Palantir、Hugging Faceを含む20社以上の企業が、政策立案者に対しオープンウェイトモデルへの時期尚早な制限を避けるよう求める書簡に署名しました。なぜOpenAIは署名しなかったのでしょうか?AnthropicがAIのゲートキーピングを好むのは誰もが知っていますが。

ChatGPT Workがログイン必須サイトに対応【続報】

  • 仕事用エージェント「ChatGPT Work」のブラウザ機能に関する続報です
  • エージェントがログイン必須のウェブサイトを利用できるようになりました
  • ユーザーがクラウドブラウザ上で一度ログインすればセッションが保持され、その後はエージェントが自律的にタスクを継続します
OpenAI Developers: (翻訳) ChatGPT Workのエージェントが、サインインが必要なウェブサイトを使用できるようになりました。クラウドブラウザを引き継いでログインし、その後エージェントにタスクを継続させることができます。ログインはセッション間で保持されるため、サインインは一度だけで済みます。

Greg Brockman: (翻訳) 人々はChatGPT Workがどのように使えるか、まだ表面をなぞっているに過ぎません。私たちはAIが人々の生活をより良くする力を与えることを望んでおり、エージェント機能がその実現の核になると信じています。

Midjourneyが占星術アプリCo-Starを買収

  • AI画像生成サービスのMidjourneyが、人気の占星術アプリ「Co-Star」を買収したことが明らかになりました。
  • Co-StarのCEOはMidjourneyのChief Design Officerに就任し、デザインやプロダクトのチームを構築します。
  • AI画像生成以外の領域への事業拡大に向けた動きとして注目を集めています。
TechCrunch: (翻訳) Midjourneyが占星術アプリのCo-Starを買収しました

Shakeel: (翻訳) なんて面白い買収なんだ (引用ツイート: MidjourneyはCo-Starを買収します。CEOのBanu GulerはMidjourneyのChief Design Officerに就任します。彼女は私たちのすべての取り組みのために、デザイン、プロダクト、フロントエンドの部門横断的なチームを構築します。Co-Starアプリは引き続きBanuの完全な管理下で運営されます。Banuとチ...

Bloomberg: (翻訳) Midjourneyが人気の占星術アプリCo-Starを買収しました。これは、AI画像生成の枠を超えて事業を拡大しようとする同スタートアップの最新の動きを示しています。

Grok 4.6/4.7のリリース計画と4.5値下げ【続報】

  • xAIのGrokに関する続報です。
  • Elon Musk氏が、Grok 4.6を2週間後、Grok 4.7を4週間後にリリースする計画を明らかにしました。
  • Grok 4.6は初期トレーニングを終えた2Tパラメータのモデルと推測されています。
  • また、Grok 4.5のAPI価格が値下げされ、入力が$0.30/1M、出力が$0.60/1Mになったことも報告されています。
Tech Dev Notes: (翻訳) イーロンによると、Grok 4.6は2週間後、Grok 4.7は4週間後にリリースされるとのこと

Haider.: (翻訳) もうブレーキはかかりません。イーロンはGrok 4.6が2週間後にローンチされ、その2週間後にGrok 4.7が続くことを確認しました。4.6はおそらく、イーロンが最近初期トレーニングを終えつつあると語った2Tパラメータのモデルであり、Grok 4.7は同じ基盤モデルを使用しつつ、より優れたポストトレーニングを施したものになるでしょう。

Tech Dev Notes: (翻訳) Grok 4.5のAPIで、キャッシュされた入力の価格が値下げされました。$0.50/$1.00から$0.30/$0.60になりました。

Gemini APIでtemperature等のパラメータが非推奨に

  • Gemini 3.6 Flashおよび3.5 Flash-Liteから、temperature、top_p、top_kのパラメータが非推奨(deprecated)になりました。
  • 開発者は今後のAPI利用において、これらのパラメータに依存しない実装が求められます。
  • モデルの挙動制御に関するGoogleの方針転換として話題になっています。
Patrick Loeber: (翻訳) 知っておくべき重要なGemini APIのアップデート:Gemini 3.6 Flashおよび3.5 Flash-Liteから、temperature、top_p、top_kが非推奨(deprecated)になります。詳細は開発者ガイドをご覧ください。

Philipp Schmid: (翻訳) Gemini 3.6 Flashおよび3.5 Flash-Liteから、temperature、top_p、top_kが非推奨になります。詳細は開発者ガイドをご覧ください。

オープンウェイトの自動ルーティングモデルDariが公開

  • コーディングエージェント向けに構築されたオープンウェイトの自動ルーティングモデル「Dari」がリリースされました。
  • キャッシュを意識したルーティングを行い、コストを70%削減しつつFableと同等のコーディング性能を達成しています。
  • Terminal-Bench 2.1において、わずか76ドルの推論コストで79.8%のスコアを記録しました。
Chubby♨️: (翻訳) 総推論コスト76ドルでTerminal-Bench 2.1において79.8%。これがDariが本日ローンチした数字です。彼らはその背後にあるルーターモデルをオープンソース化しました。これは各ステップをどのモデルが処理するかを決定する小規模なファインチューニング済みモデルで、大部分をより安価なオプションに送信します。

elvis: (翻訳) セッションの途中でモデルを切り替えることは、エージェントの請求額を膨らませる最も早い方法の一つです。切り替えるたびにプロンプトキャッシュがリセットされ、安価なモデルでも結果的にコストが高くなる可能性があります。Dariはキャッシュを意識したルーターを構築しました。実際にコストを節約できる場合にのみ切り替えを行います。

Atomic AgentがGAIAベンチマークでHermesを上回る

  • マルチエージェントシステムのAtomic Agentが、GAIA Level 1ベンチマークで69.8%を達成し、Hermesの58.5%を上回りました。
  • 同じQwen-3.6-35Bモデルを使用し、Apple M4 Max上で実行した結果、1.6倍高速にタスクを完了しています。
  • 53のタスク中37を解決し、エージェントの効率性と性能の高さが示されました。
Chubby♨️: (翻訳) Atomic AgentがGAIAでHermesを打ち破りました:69.8%対58.5%、そして1.6倍速く完了しました!彼らは同じApple M4 Max上で同じ4-bit Qwen-3.6-35Bを使用し、両方のエージェントにGAIA Level 1の全53タスクを実行させました。- Atomic: 3時間12分で37/53を解決 - Hermes: 5時間10分で31/53を解決

Claude 5世代向けのコンテキストエンジニアリング新ルール

  • Opus 5やFable 5などのClaude 5世代モデルにおいて、過度な制約を減らすことが効果的であるという知見が共有されました。
  • 細かいルールを多数与えるよりも、モデル自身の判断力に任せる方が良い結果が得られるとされています。
  • 実際にClaude Codeのシステムプロンプトは約80%削減されており、プロンプト設計のパラダイムシフトが起きています。
elvis: (翻訳) おすすめの記事です。しかし、驚くべきことや新しいことは何もありません。新しいモデルは意図を理解し、ツールを使用するのが上手になりました。システムプロンプトには、モデルの能力を置き換えるのではなく、情報を提供する好みの最小限のテキストを保存するべきです。

Oikon: 【Claude 5世代モデル向けコンテキストエンジニアリングの新しいルール】 Claude 5世代(Opus 5 / Fable 5など)では、過度な制約を大幅に減らすことが効果的。 以前: 細かいルールをたくさん与える ↓ 今: Claudeの判断力に任せる 以前: ツールの使い方を例で詳しく示す ↓ 今:

AIエージェントの失敗原因はコンテキスト肥大化との指摘

  • 本番環境で稼働するAIエージェントが失敗する原因について、推論能力の不足よりもコンテキストの肥大化が主な要因であるとの記事が話題です
  • 会話履歴や巨大なプロンプト、ツールの定義や出力結果がターンごとに蓄積されることで、エージェントの動作が不安定になると指摘されています
  • 安定したエージェントを構築するためには、コンテキストを適切に管理する手法が重要視されています
elvis: (翻訳) // エージェントのコンテキスト管理 // 週末に読むのに最適な記事です。(ブックマーク推奨)本番環境のエージェントは、推論よりもコンテキストに何があるかで失敗することが多いです。会話履歴、巨大なプロンプト、巨大なツールの定義、そして膨れ上がるツールの出力がターンごとに積み重なっていきます。

Subscribe to ML_Bear Times

(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。
(ほぼ)毎日AIニュースが届きます
ぜひご登録ください