モデル能力そのものの天井の AI ニュース

推論、多言語、専門領域で止まる。産業側はまだ手を出しておらず、着手の主語が研究室しかいない。

収集 5,792 件のうち該当 27 件。新しい順に 27 件を並べています。

誰が、どこから着手しているか

この課題を扱った記事

LLMの翻訳の問題

LLMの翻訳の問題が指摘されている。英語以外の言語で書かれた文章をLLMで翻訳した場合、元の文章と異なる内容になる可能性がある。LLMの翻訳の問題は将来の改善の課題である。

r/LocalLLaMA ・ 2026-08-14

介入対応型臨床世界モデルによる心臓手術後の予後予測フレームワーク

心房細動アブレーションなどの心臓手術後における不規則な回復経過を予測するため、介入対応型の臨床世界モデルを提案した。術前の3D画像を空間潜在状態にエンコードし、投薬や追加処置などの時系列イベントを取り込みながら状態を動的に更新する。フォローアップ画像を教師データとして潜在空間で将来を予測し、個別化されたリスク評価を実現する。

arXiv cs.LG ・ 2026-08-13

二重にロバストなCVRの因果効果推定

CVR(コンバージョン率)の因果効果を推定するために、二重にロバストな推定手法を提案した。CVRは、電子商取引や広告などで重要な指標である。提案手法は、従来の因果推論手法の限界を克服し、より正確な推定を可能にした。

arXiv cs.LG ・ 2026-08-13

ContactGuard: 予備的な実行モニタリングとアクション条件付き潜在世界モデル

ContactGuardは、予備的な実行モニタリングとアクション条件付き潜在世界モデルを用いたロボットの安全性を向上させるシステムである。ContactGuardは、ロボットの予備的な動作を予測し、失敗の可能性が高い場合は中止する。実験結果は、ContactGuardがロボットの安全性を向上させることを示している。

arXiv cs.AI ・ 2026-08-13

視覚言語モデルの空間推論能力を評価するベンチマークMindTopo

マイクロソフトリサーチが、視覚言語モデル(VLM)のトポロジー的関係性の理解度を評価する新ベンチマーク「MindTopo」を発表した。経路や柵、結び目などの認識を通じて、AIの空間推論と計画能力の課題と進化を明らかにする。

Microsoft Research ・ 2026-08-12

科学分野の動画生成AIを知識・推論面から評価するSci-VBench

科学分野における知識および推論を要する動画生成モデルを評価するためのベンチマーク「Sci-VBench」が開発された。自然科学や医療など4分野60主題にわたる専門家注釈付きの1,253事例が含まれている。16種類の主要モデルを評価した結果、視覚的品質が高くても科学的な正確性や時系列推論の達成度には課題があることが示された。

arXiv cs.AI ・ 2026-08-10

言語モデルにおける2ステップの複合推論失敗メカニズムの解明

言語モデルが単一の知識を保持しながらも2段階の推論で失敗する現象について、トランスフォーマー内部の機構解析が行われた。2番目のステップが訓練分布に従う場合は共通のエンティティ表現が形成され成功するが、分布外になると内部表現の不一致で失敗することが確かめられた。

arXiv cs.CL ・ 2026-08-07

LLMエージェントの自己進化におけるスキル汚染問題の防止技術

自己進化型LLMエージェントがスキルを蓄積し過ぎると誤った推論が伝播して性能が低下する「スキル汚染」現象を解明した。後から不具合スキルを削除しても回復できないため、獲得前に検証を行うゲートキーパー「VaG」を導入して信頼性を維持する手法を提案した。

arXiv cs.CL ・ 2026-08-06

データセンター制御プレーンポリシーを自動生成するAtumAI

データセンターの効率を左右する複雑な制御プレーンポリシーを、エージェント型AIによって体系的かつ形式的に生成するフレームワーク「AtumAI」を提案しています。従来の手法における設計空間の狭さや移転性の課題を克服し、自動化の精度を高めます。

arXiv cs.AI ・ 2026-08-03

音声翻訳システムにおける言い淀みがもたらす影響と翻訳品質の分析

音声翻訳システムがクリーニングされたテキストで訓練されることで、言い淀みや言い直しといった重要な意味情報を失っていることを明らかにした研究。英語から8言語への翻訳ベンチマーク「Uh-Mazing」を導入し、翻訳品質の低下を引き起こす要因を体系的に分析した。推論時のデコーディング調整により再学習なしで改善できる点を示している。

arXiv cs.CL ・ 2026-08-03

長文推論の精度低下を防ぐKVキャッシュ圧縮手法ResKVが登場

長文コンテキスト推論を効率化するため、除外されたトークンのアテンション寄与度を復元するKVキャッシュ圧縮手法「ResKV」が提案された。メインキャッシュとコンパクトな残差キャッシュを組み合わせることで、精度低下を抑えつつメモリを節約する。

arXiv cs.CL ・ 2026-07-31

LLMではなく世界モデルが科学的革命を起こす可能性をDeepMindが示唆

Google DeepMindの研究者が、言語モデル(LLM)のみでは真の革新を生み出す認知メカニズムが不足していると主張する論文を発表した。科学革命を推進するには、物理的な構造や因果関係を理解する「世界モデル」の構築が必要不可欠であると指摘している。

The Decoder ・ 2026-07-30

RKHSを用いて敵対的訓練における頑健性と汎化性能の限界を理論的解析

モデルを敵対的攻撃から保護する敵対的訓練について、再生カーネルヒルベルト空間(RKHS)の枠組みを用いて理論的な解析を行った。敵対的頑健性と観測ノイズの相互作用により、統計的精度の低下や汎化性能の限界が生じるメカニズムを明らかにしている。

arXiv stat.ML ・ 2026-07-30

人間動画からロボット学習用データを生成するPegasus

人間の操作動画からロボットが直接学習できないギャップを埋めるため、低リソースフレームワーク「Pegasus」が提案されました。物理的制約やアフォーダンスを考慮してタスクグラフをロボット計画グラフに変換することで、身体的AIにおける学習データ不足を解消します。

arXiv cs.AI ・ 2026-07-29

DIRECT: LLMを用いた高速かつドメイン適合した系列ラベル付け手法

大規模言語モデルを用いた系列ラベル付けにおける推論効率低下と不十分なドメイン適合を解決する「DIRECT」フレームワークを提案した。DPOによる人間選好への最適化とKV Cacheを活用した直接デコーディングにより、高精度と大幅な計算コスト削減を達成した。

arXiv cs.CL ・ 2026-07-29

科学図表の情報抽出に関するICDAR 2026コンペティション

科学論文中の図表からマルチモーダルAIを用いて情報を抽出・推論するタスクの性能と限界を評価するコンペティションを実施した。最先端のマルチモーダルモデルでもデータ抽出や視覚的質問応答に課題があることが明らかになった。

arXiv cs.CV ・ 2026-07-29

分散推論の精度を低下させる新たな脆弱性攻撃の手法

高速なローカル処理と高精度なリモート処理を組み合わせた分散推論システムに対する新たな脆弱性攻撃「Denial of Deadline」が提示された。意図的なネットワークトラフィック制御によりリモート処理の遅延を引き起こすことで高精度な結果を無効化させ、推論精度を意図的に低下させられるリスクを明らかにした。

arXiv cs.AI ・ 2026-07-27

AI 課題の四象限へ