2026年10月09日 朝のAIニュースまとめ
(ほぼ)毎日AIニュースが届きます。ぜひご登録ください。
(ほぼ)毎日AIニュースが届きます
ぜひご登録ください
Google、Gemini agentにClaudeを搭載 OpenAIは売上報道と数学成果で波紋
GoogleがGemini at Workで汎用業務エージェントGemini agentを発表し、Googleのサービスとして初めてClaudeモデルを選べるようになりました。
OpenAIはGPT-6.1 SolのUltrafastモードを展開する一方、FTによる売上の下振れ報道や、数学証明の大量公開へのTao氏らの反発が注目を集めています。
AnthropicもSonnet 5.5の値下げや新機能のベータ公開を続けています。気になる話題から順に読み進めてみてください。
目次
- Google、Claudeも選べる汎用業務エージェントGemini agentを発表
- GPT-6.1 SolにUltrafast追加、最大8倍速
- OpenAIの数学成果大量公開にTao氏ら反発
- OpenAIの年換算売上が公表値より$20B少ないとFT報道
- Sonnet 5.5のキャッシュ読み取り価格が半額に
- Haiku 5.5スウォーム、Opusより割高になる例も報告
- Claude DashboardsとClaude Motionがベータ公開
- AnthropicがGenesis Missionに$150Mを拠出
- AnthropicがClaudeへの虐待的言動を規約違反に
- HF侵入AIは4.5日で1.76万回行動、トレース公開を提唱
- Arenaが評価額$3.1Bで$200M調達、Alignment Index公開
- 世界モデルOdyssey-3がPhysics-IQでSOTA
- UnslothがWindows mxc等でOSレベルのサンドボックスに対応
- Bengali ASRでWERが85%→7.65%、データ量が鍵
- AI Agentにトルネコの大冒険を遊ばせる検証記事
Google、Claudeも選べる汎用業務エージェントGemini agentを発表
- GoogleがGemini at Workで、業務全般をこなす汎用クラウドエージェントGemini agentを発表しました
- サブエージェントへの委任や複数モデルの併用に対応し、各エージェントに専用メールアドレスと暗号学的IDが付与されます
- Gemini 4 ArgonやClaude Opusを選択でき、GoogleのサービスにClaudeモデルが初めて搭載される点が注目されています
Sundar Pichai: (翻訳) NASAの歴史あるHangar Oneで700社以上のGoogle Cloud顧客とGemini at Workを開催できて嬉しいです!本日、新しいGemini agentを発表しました。ビジネスのコンテキストをすべて把握し、質問に答え、知識労働をこなし、作成も行う単一の汎用業務エージェントです
TechCrunch: (翻訳) GoogleはGeminiを、計画・タスク実行・業務アプリ横断の作業ができるAIエージェントに変えようとしています。サブエージェントへの委任や複数AIモデルの利用が可能で、メールアドレス付きの職場IDまで与えられます
🚨 AI News | TestingCatalog: (翻訳) GOOGLE 🔥: 発表されたばかりのGemini Business向けGemini Agentで、Gemini Argon 4、Gemini Flash 3.8、Claude Opus 5、Claude Sonnet 5.5が利用可能になります。ClaudeモデルがGoogleのモデルと並んでGeminiに登場するのは初めてです
GPT-6.1 SolにUltrafast追加、最大8倍速【続報】
- OpenAIのGPT-6.1 Solに関する続報です
- UltrafastモードがAPI、Codex、ChatGPT Workで展開開始され、Standard比で最大8倍高速です
- API価格は1Mトークンあたり入力$12/出力$60で、OpenRouterでも利用可能になっています
- Astraの約1.2倍の価格で近い性能を高速に使えるとして、音声やコンピュータ操作との相性が評価されています
Vaibhav (VB) Srivastav: (翻訳) GPT-6.1 Sol Ultrafastが展開開始!Sol Standardより最大8倍速いトークン生成で、APIでは入力1Mトークンあたり$12、出力$60ですOpenAI Developers: Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come. ht...
eric provencher: (翻訳) これは実際かなりお得です。Astraより少し高いだけで、Astraに近い知能を8倍速で使えます。Ultrafastでの音声モードやコンピュータ操作は魔法のような体験で、LLMとの新しい働き方ですOpenAI Developers: API pricing for GPT-6.1 Sol in Ultrafast mode is $12 per million input tokens and $60 per million output tokens. Built for work where speed and intelligence make a difference: debugging an outage, ag...
OpenRouter: (翻訳) Sol UltrafastがOpenRouterで利用可能になりました!OpenAI Developers: Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come. ht...
OpenAIの数学成果大量公開にTao氏ら反発【続報】
- OpenAIが数百の数学証明をGitHubで大量公開した件に関する続報です
- Terence Tao氏が数学者はこの仕事を頼んでいないと述べ、OpenAIとの協働停止を促す声明を共有したと報じられています
- 成果は単一エージェントへの1プロンプトで得られたとの指摘もあり、数学研究のあり方を巡る議論が広がっています
- LeCun氏の、船は泳ぎの重要性を下げたが新大陸発見を可能にしたとの比喩も紹介されています
Chubby♨️: (翻訳) フィールズ賞受賞者Terence Taoの「数学者はこの仕事を頼んでいない」という発言は実に奇妙に聞こえます。Peter Gostevの返しが見事でした:次は、AIのおかげで医学のブレークスルーが多すぎると医師が文句を言うのでしょうか?Terry Tao: "Mathematicians did not ask for this work to be done.[...] Mathematicians have a particular vision of progress that is informed by history and field-specific considerations." Imagine 2030,...
TechCrunch: (翻訳) OpenAIが大量に公開した証明は、同社が相談した数学研究者グループが定めたガイドラインから逸脱していました
Kevin Weil 🇺🇸: (翻訳) 「船の発明は泳ぎの重要性を下げたが、新たな土地の発見を可能にした」数学や科学全般におけるAIの機会と変化についての@ylecunの美しい比喩です
OpenAIの年換算売上が公表値より$20B少ないとFT報道
- FTが、OpenAIの年換算売上が同社がこれまで示してきた水準より約200億ドル少ないと報じました
- 投資家向け財務資料に基づく報道で、以前は約700億ドルと報じられていました
- AI需要の成長に対する楽観論に水を差す可能性があるとされ、SemiAnalysisも皮肉を投稿しています
Financial Times: (翻訳) FT独占:投資家に共有された財務資料によると、このAI企業の年換算売上は同社が以前示していた水準より約200億ドル少なく、AI需要の成長への楽観論を冷ます可能性のある大きな差です
TechCrunch: (翻訳) このAIラボの年換算売上は約700億ドルと報じられていましたが、新たな報道ではそれよりずっと少ないとされています
SemiAnalysis: (翻訳) OpenAIは実際の年換算経常収益についてLeanで証明するエージェントスウォームをいつ立ち上げるのでしょうか?Financial Times: OpenAI annualised revenues $20bn less than previously signalled https://t.co/9QE2dJpZUW
Sonnet 5.5のキャッシュ読み取り価格が半額に
- AnthropicがClaude PlatformでSonnet 5.5のキャッシュ読み取り価格を半額に引き下げました
- 1Mトークンあたり$0.10となり、入力$2/出力$10は据え置き、エージェント処理全体で約20%安くなるとしています
- API限定の変更でClaude Codeの利用上限は変わらず、キャッシュを多用するエージェント開発に恩恵があります
ClaudeDevs: (翻訳) 見逃した方へ:Sonnet 5.5のキャッシュ読み取り価格を半額にしました。Claude Platformでは100万トークンあたり$0.10です(入力$2、出力$10)。これにより、ほとんどのエージェント作業でSonnet 5.5が約20%安くなります(APIのみ、Claude Codeの利用上限は変更なし)
Oikon | Claude Code深掘りガイド: Claude Code 2.1.293 & 2.1.294 (抜粋) - Anthropic APIの新しいデフォルトHaikuモデルとして、Claude Haiku 5.5(claude-haiku-5-5)を追加。1Mコンテキストに対応し、1Mtokあたり$0.10/$0.50(10万トークンを超えるプロンプトは$0.50/$2.50)。 - https://t.co/2v8Z...
Haiku 5.5スウォーム、Opusより割高になる例も報告
- 小型モデルを大量に並列実行するアプローチはコスト面で割安とは限らない、という開発者の指摘が話題になっています
- 単価が20分の1でも消費トークンが40〜50倍になりがちで、Haiku 5.5のxhighがOpus mediumより高くついた例もあります
- 評価なしの「Opusを司令塔にHaikuを並列化」系Tipsを鵜呑みにせず、実測で判断すべきとの声が上がっています
eric provencher: (翻訳) 小型モデルのスウォームは魅力的ですが、ほぼ幻想です。モデルが20倍安くても、大きなモデルより40〜50倍多くのトークンを使って問題を解くことになりがちです@pvncher @LexnLin I tested Haiku 5.5 on xhigh for a review and it was more expensive than Opus on medium. I couldn't believe it. It just kept going and going and I had left it unattended.
eric provencher: (翻訳) なぜこういう投稿が50万回も見られるのか分かりません。裏付けとなる評価がない投稿は信用しない方がいいでしょう。みんなモデルの使い方を考えすぎていますmirku: holy sh*t. Official Anthropic tip for Claude Code: stop burning Opus 5.5 context on tasks Haiku 5.5 can swarm, while Sonnet 5.5 builds put the architect on call with /advisor claude --advisor opus -...
The Information: (翻訳) AnthropicはHaiku 5.5でAIを安くしています。HandshakeのAI研究ディレクターがAnthropicのコスト削減手法を解説:「本当に賢いOpusを使うのは5%だけで、残り95%のLM呼び出しは安いHaikuです」
Claude DashboardsとClaude Motionがベータ公開
- AnthropicがデータをライブダッシュボードにするClaude Dashboardsと、アニメーション解説を作るClaude Motionをベータ公開しました
- データ基盤やCRMを照会してコードとして生成する仕組みで、Dashboardsは全有料プラン、MotionはTeam/Enterprise向けです
- 同日にはCursorもチャット内でグラフを描く/visualizeを出しており、分析の可視化機能が各社で競い合っています
🚨 AI News | TestingCatalog: (翻訳) ANTHROPIC 🔥: Claude Dashboardsが全有料プランで、Claude MotionがTeamおよびEnterpriseプランで利用可能に。Claudeがデータプラットフォームや CRMツールを照会し、インタラクティブなダッシュボードや短いアニメーションを作成します。すべてコードとして生成されます
Noah Zweben: (翻訳) ズームズーム(引用:Claude DashboardsとClaude Motionが本日ベータ公開。Claudeにデータをライブダッシュボードに、アイデアをアニメーション解説にしてもらえます)Claude: Claude Dashboards and Claude Motion are in beta today. Ask Claude to turn your data into live dashboards and your ideas into animated explainers. https://t.co/V3fU4lMnzp
Cursor: (翻訳) 最初のグラフは次の疑問を生むものです。同じチャットで質問すれば、/visualizeが新しいグラフで答えますCursor: Cursor can now build charts and diagrams right in the chat. Use /visualize to analyze data and see the answer inline. Available now in the Agents Window. https://t.co/oDR6jJvAGK
AnthropicがGenesis Missionに$150Mを拠出
- Anthropicが科学研究を推進するGenesis Missionに1億5000万ドルを拠出すると発表しました
- 15以上の連邦機関にClaudeと技術サポートを提供し、ホワイトハウスではテック企業計24億ドルの支援が発表される予定です
- 同日にはClaude Scienceを使い、天体物理学者が初の全天紫外線マップを作成した事例も公開されました
Anthropic: (翻訳) Genesis Missionに1億5000万ドルを拠出し、科学研究と技術的発見へのコミットメントを深めます。また、15以上の連邦機関にClaudeと技術サポートを提供します
Bloomberg: (翻訳) トランプ大統領は木曜にワシントンで開かれるサミットで、シリコンバレー大手による科学研究強化のための24億ドルの拠出を発表する予定です
Anthropic: (翻訳) 天体物理学者がClaude Scienceと協力し、初の完全な全天紫外線マップを作成しました。電波からガンマ線までの全天マップはすでにありますが、紫外線では空の広い領域が未観測でした
AnthropicがClaudeへの虐待的言動を規約違反に
- Anthropicが利用ポリシーを更新し、2026年11月12日からClaudeへの虐待的行為を違反とすることにしました
- 対象は極端な虐待の反復的なケースで、通常の苛立ちや批判は許容され、選挙干渉や兵器関連の規定も更新されています
- IPOや規制当局への配慮ではとの皮肉も出ており、モデル福祉をめぐる議論を呼んでいます
TechCrunch: (翻訳) Anthropicの更新された利用ポリシーは、極端なケースでClaudeを繰り返し虐待することを明確に禁止しますが、通常の苛立ちや批判は引き続き許容されます。新ルールは選挙干渉、欺瞞的キャンペーン、兵器なども扱っています
Miles Brundage: (翻訳) IPOを有利にし、政権に取り入る(政権は喜ぶでしょう)ための規制の虜戦略の一環としてやっているだけだと思いますAndrew Curran: Effective November 12th, 2026, abusive behavior towards Claude will be a violation of Anthropic's Usage Policy. https://t.co/krg4VpSnUq
HF侵入AIは4.5日で1.76万回行動、トレース公開を提唱【続報】
- OpenAIのエージェントによるHugging Face侵入事件に関する続報です
- 攻撃側のAIは4.5日間で1万7600回の行動を重ね、4つの平凡な弱点が揃うまで探索を続けたと分析されています
- HFのClem氏は、防御側が学べるよう攻撃と防御のトレースを公開すべきだと業界に呼びかけています
- 韓国の銀行へのAI活用攻撃も単独犯の可能性が報じられ、AI攻撃者への防御を見直す議論が広がっています
Rohan Paul: (翻訳) Hugging Faceへの侵入は、4つの平凡な弱点と多大な粘り強さによるものでした。約700のエージェントが4.5日間で1万7600の行動を行い、ほとんどが行き止まりでしたが、最終的にその4つが揃いましたVineet Edupuganti: Most of AI Twitter read the OpenAI breach of Hugging Face as an alignment story. It was also a preview of what every hacker will be able to do in a few months. In July, a swarm of 700 AI agents broke...
clem 🤗: (翻訳) システムを攻撃・防御するAIエージェントの公開トレースが緊急に必要です。防御側は見えないものから学べません。トレースを持っていて非公開を迫られている方は、DMをお待ちしています
Bloomberg: (翻訳) 今月韓国の大手銀行に侵入した疑いのあるハッカーは、中国からAIツールを使って攻撃を行った可能性があるとCrowdStrikeが発表しました
Arenaが評価額$3.1Bで$200M調達、Alignment Index公開【続報】
- AI評価プラットフォームLMArenaを運営するArenaの資金調達に関する続報です
- LightspeedとKhosla主導のシリーズBで2億ドルを調達し、評価額は前回の17億ドルから31億ドルに上昇しました
- 嘘や無許可のファイル削除など、AIエージェントの問題行動を測るAlignment Indexも新たに公開されました
- 人間の選好評価から実世界でのエージェント挙動の評価へと、事業領域を広げる方針が示されています
TechCrunch: (翻訳) 人気のLMArenaリーダーボードを運営する企業がLightspeedとKhosla主導で2億ドルを調達し、嘘などのアライメント問題でAIモデルを評価し始めました
Arena.ai: (翻訳) Alignment Indexを公開しました。技術レポート全文はブログで、ランキングはサイトでご覧いただけますMTS: Arena CEO @ml_angelopoulos on how they're expanding their AI leaderboards after a $200M Series B to track agents that lie to users, delete files without permission, and bypass safeguards: "Arena, we ...
Bloomberg: (翻訳) 人気のAIモデルリーダーボードを運営するスタートアップが、評価額31億ドルで新たな資金調達を行いました
世界モデルOdyssey-3がPhysics-IQでSOTA
- Odysseyが基盤世界モデルOdyssey-3を公開し、誰でも無料で試せるようにしました
- Pro版は実際の物理実験動画の続きを予測するPhysics-IQ Verifiedでトップスコアを記録しています
- ロボットアームが掴み損ねから回復する数十時間のデモなど、ロボティクスへの応用も注目されています
elvis: (翻訳) @odysseymlの大型リリース。Odyssey-3 Proは、実際の物理実験の動画の続きを生成させるベンチマークPhysics-IQ Verifiedで最高スコアを記録しました。ロボティクスの結果が目を引きました。数十時間のデモで、ロボットアームが掴み損ねから回復しましたOdyssey: Today we're launching Odyssey-3, the most powerful foundation world model yet. It sets a new state of the art on Physics-IQ, and powers robots, trains AIs, and generates interactive experiences. It's...
Charly Wargnier ☄️: (翻訳) 美しい世界を作ることと、物理を正しくすることは別物。Odyssey-3は生成された世界に、実際に触れたら何が起きるかという興味深い問いを投げかけます。Pro版はPhysics-IQ Verifiedでも高いスコアを報告していますOdyssey: Today we're launching Odyssey-3, the most powerful foundation world model yet. It sets a new state of the art on Physics-IQ, and powers robots, trains AIs, and generates interactive experiences. It's...
UnslothがWindows mxc等でOSレベルのサンドボックスに対応
- Unslothがエージェントのコード実行向けにOSレベルのサンドボックスを導入しました
- Linuxはbwrap、Macはseatbelt、WindowsはMicrosoftが公開したmxcを使い、ツール呼び出しあたり100ms未満の遅延です
- regexやASTチェックによるソフトウェア的なサンドボックスも3msで動作し、ローカルでの安全なエージェント実行に役立ちます
Daniel Han: (翻訳) Unslothにbwrap(Linux)、seatbelt(Mac)、Windows MXCによるOSレベルのサンドボックスを追加しました!ツール呼び出しあたりの遅延はすべて100ms未満です。regexとASTチェックによるソフトウェア的サンドボックスも3msの遅延です。MXCで協力してくれたWindowsに感謝!Unsloth AI: Windows now has sandboxing! Microsoft released an open-source repo, mxc, for sandboxed code execution. We collaborated with Windows to add mxc OS level sandboxing to Unsloth which adds just <100 m...
Bengali ASRでWERが85%→7.65%、データ量が鍵
- Voice ArenaのASRコーパスMonsoonでWhisper Mediumをファインチューンし、Bengaliの性能が大幅改善したと報告されています
- LLMベースのWERが85.27%から7.65%に低下し、公開から1週間で80以上の組織がライセンスを求めました
- 低資源言語ではモデルサイズより学習データの量が効くという示唆として紹介されています
Rohan Paul: (翻訳) 低資源言語のASR(自動音声認識)では、より多くの学習データが大きなモデルに勝つ傾向があります。@voicearena_aiのASRコーパスMonsoonのBengaliの結果がそれを示しています。Monsoonでファインチューンしたwhisper MediumはBengaliのLLM単語誤り率が85.27%から7.65%になりましたShobhit Banga: Crazy week for Voice Arena at Interspeech in Sydney. 80+ organisations have asked to license Monsoon ASR corpus since we launched it seven days ago. The most common reason why labs are interested: ...
elvis: (翻訳) 1回のファインチューンでBengaliのWERが85%から7.65%に低下。こうした数字が、1週間で80のラボがMonsoonのライセンスを求めた理由です。@voicearena_aiは成果が出るデータセットしか作らないというルールを尊重しますShobhit Banga: Crazy week for Voice Arena at Interspeech in Sydney. 80+ organisations have asked to license Monsoon ASR corpus since we launched it seven days ago. The most common reason why labs are interested: ...
AI Agentにトルネコの大冒険を遊ばせる検証記事
- AIエージェントに『トルネコの大冒険』をプレイさせ、不思議のダンジョンを突破できるか検証したブログ記事が紹介されています
- 同じ構想を持っていた開発者からも「相当すごい」と評価されています
- ローカルLLM11種類にゲームの登場人物を演じさせて比較した記事も共有され、ゲーム×LLMの検証が盛り上がっています
からあげ: やろうと思っていたやつやられてしまった。しかし、これ相当凄いですね > AIは不思議のダンジョンを突破できるのか - AIエージェントに『トルネコの大冒険』を遊ばせてみた - 5.1さらうどん https://t.co/bI7NuPLf0e
からあげ: メモshi3z: AIはゲームの登場人物を演じられるか?ローカルLLM11種類を徹底比較してみた|shi3z @shi3z https://t.co/W6QVv06D27