NVIDIAのAIエージェント「AVO」がARC-AGI-3で100%を達成、同じベースモデルの別条件での評価は約30%で「実行基盤(ハーネス)」の重要性が示される

AI要約
NVIDIAのAIエージェント「AVO」が、AI ARC-AGI-3評価においてRHAE指標で100%を達成しました。これは、同じベースモデルClaude Opus 5を使用した別条件の評価で約30%だったのに対し、実行基盤(ハーネス)の重要性を示す結果となっています。AVOは永続的なメモリや監督機能を備え、長時間の自律作業を可能にしており、AIモデル単体の性能だけでなくシステム全体の設計が性能に大きく影響することを示しています。NVIDIAはこの成果がGPUコード最適化向けのエージェント構造の汎用性を示すと説明し、今後さらなる検証を進める意向です。
元記事を読む →AI NEWS JAPAN ANALYSIS
AI NEWSジャパン独自の分析
この記事の独自分析は準備中です。
AI評価
85点 / 100点YANSU AI VIEW
やんすAIの視点
AI NEWS ジャパン独自の視点から、このニュースをひとこと解説します。

やんすAI
AI NEWS ジャパン
「AIやテクノロジーの動き、これからも目が離せないでやんす🤖」
PICK UP
この記事に関連するサービス
この記事の内容に関連した、読者に役立つサービスをご紹介します。
※広告・アフィリエイトリンクを含みます
関連記事

ローカル実行可能で画像入力もOKな意思決定モデル「d1-3B」と音声入力も可能な「d1-omni-600M」が登場、OpenAIのDecisions APIより高速実行
Liquid AIがローカル実行可能な意思決定モデル「d1-3B」と「d1-omni-600M」をリリースした。これらはテキスト、画像入力に加え、d1-omni-600Mは音声入力にも対応し、OpenAIのDecisions APIより高速に動作することが報告されている。両モデルはオープンモデルとしては高性能であり、低コストかつ高速な意思決定処理が可能である。
Anthropic、「Claude Haiku 5.5」公開 「Haiku 4.5」から大幅性能向上で利用コスト約75%減
米Anthropicは小型モデルの最新版「Claude Haiku 5.5」を発表し、前世代のHaiku 4.5から性能を大幅に向上させつつ、利用コストを約75%削減した。Haiku 5.5はコスト重視の大量処理向けで、要約や会話履歴圧縮、データベース問い合わせなどに適し、全プラットフォームで即日提供を開始。ベンチマークではOpenAIのGPT-6 Lunaを上回る性能を示したが、複雑なエージェント型コーディングにはSonnet 5.5やOpus 5.5が適している。セキュリティ面ではHaiku 4.5より強化されているが、他モデルには及ばず、過剰拒否やハルシネーションの課題も残る。

125Bの「Qwen3.8-Flash-Next」の量子化版をゲーミングPCで高速ローカル実行可能にするAI実行アプリ「Strata」
「Strata」は1250億パラメーターの大規模AIモデル「Qwen3.8-Flash-Next」の量子化版を、ハイエンドゲーミングPCで高速にローカル実行可能にするアプリである。VRAMやRAM容量に応じて異なる量子化版を実行でき、NVIDIAやAMDのGPU環境での動作報告もあるが、量子化による性能低下の課題も指摘されている。
