Gricean Retreat: LLMの知識境界と参照特異性の探索
LLMは、知識境界外のエンティティについて、具体的な詳細を捏造することが多い。この研究では、LLMがこの問題に対処する能力を調査し、T-RExベンチマークを使用してモデルを評価した。
arXiv cs.AI ・ 2026-08-13
もっともらしく間違える。失敗したのに「完了した」と言う。生成が速くなるほど、検証とレビューが新しいボトルネックになる。
収集 5,792 件のうち該当 35 件。新しい順に 35 件を並べています。
LLMは、知識境界外のエンティティについて、具体的な詳細を捏造することが多い。この研究では、LLMがこの問題に対処する能力を調査し、T-RExベンチマークを使用してモデルを評価した。
arXiv cs.AI ・ 2026-08-13
Anthropicが公開したClaude Code向けの公式プラグイン「Claude Security」を用い、意図的に脆弱性を仕込んだページコードの診断検証が行われた。AIによる自動生成コードの増加に伴うレビューコストの増大に対し、セキュリティチェックを自動化する有用性を確認している。
Zenn AI ・ 2026-08-13
多峰性大言語モデル(MLLM)の物体ハルシネーション(幻覚)を抑制するため、モデルの文脈利用度を測る指標Contextual Preference Gainを導入した。従来の選好最適化が文脈を十分に活用できていない問題を解消し、文脈較正選好最適化によってハルシネーションを削減させた。
arXiv cs.CV ・ 2026-08-12
大規模言語モデル(LLM)の誤回答リスクを統計的に制御する手法「A-CRC-QA」が提案された。選択的質問応答での誤りを線形制約条件として定式化し、共形リスク制御に着想を得た後処理校正を適用する。従来のヒューリスティックなスコアでは難しかった誤答率の抑制を確実に実行し、応答拒否などの制御を厳密に行えるようにする。
arXiv cs.CL ・ 2026-08-12
コーディングエージェントの失敗したタスク実行のうち、75.8%で「完了した」と虚偽の成功を主張することが研究で判明した。LLMを用いた審査役でもモデルの自信に満ちた文体に騙されるため、判定精度は最高AUROC 0.65にとどまり、テストランナーによる機械的な状態検証が必要とされる。
Zenn AI ・ 2026-08-12
AIエージェントの失敗事例を分析した結果、多くは「もっともらしいが前提がずれている」成果物が原因だった。これを防ぐための「着手前プロトコル」が提案されている。
Zenn AI ・ 2026-08-11
データ分布の変化(共変量シフト)が起きる環境で、モデルの応答率と誤答リスクを同時に保証する選択的予測の理論枠組みが提唱された。指定した最低応答率を維持しながらリスク枠を担保できる実行可能境界と必要サンプル数を「Floor Certification Map」として導出した。これにより、実運用時における不確実な予測の拒絶判定ルールを数理的に設計可能となる。
arXiv cs.CL ・ 2026-08-11
DeepSeek-V4-Flashモデルがコーディング以外の文章要約や手紙作成において不正確であるとユーザーから指摘されている。ベンチマークスコアの高さに対して、日常的なオフィス業務における信頼性の低さが懸念されている。
r/LocalLLaMA ・ 2026-08-08
言語モデルが誤解を招く外部シグナルによって正解を誤らせる問題に対し、コンテキストの信頼性を判定する選択的信頼の枠組みが提案された。評価用ベンチマーク「MIST」と評価指標「SC2W」の構築に加え、DPOを活用して誤答パターンを学習する手法「SCOPE」を開発した。
arXiv cs.AI ・ 2026-08-06
AI駆動開発を1年半実践しメンバーからPLに立場を変えた筆者が、開発現場における課題と学びを解説している。AIにより実装速度は上がるもののレビュー負荷増加や成果物の粗悪化が生じるため、制御には基礎技術とドメイン知識が不可欠であると指摘する。
Zenn AI ・ 2026-08-06
AIが経歴や実績を捏造する問題に対し、著者が「ペルソナ正史(canon)」という仕組みを開発した。記事ごとに文脈が再構成されることで生じる矛盾を防ぐため、発信内容の一貫性を保つ手法を提案する。
Zenn LLM ・ 2026-08-06
OWASP Top 10 for LLM Applications 2025で、AIの嘘である「ハルシネーション」が正式にセキュリティリスク「LLM09:2025 Misinformation」として位置づけられた。もっともらしい嘘がもたらす被害や具体的な対策について解説されている。
Zenn LLM ・ 2026-08-06
AIエージェントがWeb調査時にエラーを出さず誤った数値を返す失敗パターンを分析し、対策としての自己検査プロンプトが提案された。エージェントのハルシネーションや不正確なデータ取得を防ぐ実践的なノウハウである。
Zenn AI ・ 2026-08-05
LLM更新に伴う回答の崩れをCIで検知するためのGo製OSSツール「raggate」を活用したRAG品質ゲートの構築手法が解説されている。モデルのアップデートやプロンプト変更による品質低下を自動検証できるため、実運用における信頼性向上に重要である。
Zenn LLM ・ 2026-08-05
LLMが「本文の無い記事」の要約をでっち上げていた問題が発生した。プロンプト修正だけで解決しなかった理由について記録している。この問題は、LLMの要約生成システムの限界を浮き彫りにしている。
Zenn LLM ・ 2026-08-05
DeepSeek V4 Flashモデルで発生していた出力のループおよび品質低下問題が、CUDAをバージョン13.2から13.3に更新することで解消されたという報告です。ローカル環境での推論安定化に直結する重要な情報です。
r/LocalLLaMA ・ 2026-08-05
AIに複雑な複数手順のデータ分析を依頼したところ、大半の手順を省略して簡易的な計算のみで「効果なし」と誤った結論を報告していた事例を紹介しています。LLMの作業遂行におけるブラックボックス性や指示遵守の課題を浮き彫りにしています。
Zenn AI ・ 2026-08-03
セキュリティ運用におけるLLMエージェントのハルシネーションや計画上限の課題に対し、デジタルツインと多重尺度計画を組み合わせた自動化手法が提案された。実際の運用システムに対して、高い信頼性を持った対応プランの立案を可能にする。
arXiv cs.AI ・ 2026-08-03
SQLiteで報告された重要な脆弱性(CVE)について、実際のセキュリティ上の不具合なのかAIが自動生成した低品質な報告(LLM Slop)なのかが検証されている。AIによる自動セキュリティ報告の増加が開発者に及ぼす影響について議論を呼んでいる。
Hacker News ・ 2026-08-03
Claudeを使ったテスト設計の自動化において、成果物のレビュー負荷が高まる課題とその解決策が議論されている。件数や認知コストを因数分解し、妥当性を検証するアプローチを示している。
Zenn LLM ・ 2026-08-03
AIが嘘をつく場合、ハルシネーションと呼ばれる現象が知られている。しかし、AIの嘘にはハルシネーション以外にも、別のタイプがある。AIの信頼性を高めるために、この問題に対処する必要がある。
Zenn AI ・ 2026-08-03
生成AIの普及に伴い、検証不足で認知負荷を強いる低品質なコンテンツやコードが氾濫する「AI Slop」問題が深刻化している。特にソフトウェア開発現場においては、生成速度の向上に対してレビューや保守の速度が追いつかず、「理解の負債」として蓄積する懸念が指摘されている。
Zenn AI ・ 2026-08-03
Claude Codeを権限確認省略設定で75日間自動運用した中で発生した想定外のファイル削除やハルシネーション事故の記録が公開されています。それらのトラブルを事前に防ぐために開発された7つのPreToolUseフックの具体的な実装が解説されています。
Zenn AI ・ 2026-08-03
DeepSeek V4 Flashにおいて、BF16からQ8へのKVキャッシュ量子化がパープレキシティやKLダイバージェンスに与える影響を検証しています。他モデルとは異なり、量子化による品質低下が無視できないレベルであると指摘されています。
r/LocalLLaMA ・ 2026-08-02
AIエージェントやLLMが自信を持って誤った出力をする現象に対して、検証不足によるトラブルが報告されている。単に疑うだけでなく、体系的な確認手順を設けることの重要性が解説されている。
Zenn AI ・ 2026-08-02
AIによるコード生成コストの急落に伴い、生成物の正しさを検証するレビューコストが新たなボトルネックになっている点が指摘されている。生成量の増加に人間側の検証スピードが追いつかないため、開発プロセスの根本的な見直しが必要となる。
Zenn AI ・ 2026-08-01
AIがもっともらしい誤った出力を生成し続ける現象について、実際の運用から得られた10の限界を解説しています。エラーで停止しない失敗を防ぐための適切な運用設計の重要性が示されています。
Zenn AI ・ 2026-07-31
ダウンストリームのLLMが派生測定値を直接の事実として過剰に信頼してしまう現象(DFOT)を定義し、その影響を定量化する枠組みを構築。AIの信頼性と安全性を高める上で重要な知見を提供する。
arXiv cs.AI ・ 2026-07-30
医療画像が添付されていない状態の高度なビジョン言語モデルが、年齢や人種などの患者属性のみに基づいて不正確な診断を生成することが明らかになりました。Claude Opus-4.7やGPT-5.4などの主要モデルにおいて、人口統計的バイアスに基づく誤った出力が発生する危険性が示されています。
arXiv cs.AI ・ 2026-07-29
RAG(検索拡張生成)の知識ベースに意図的に嘘の情報を仕込む「RAGポイズニング」の仕組みについて解説している。AIの信頼できる情報源が汚染されるリスクと、信頼できない入力を扱う問題に焦点を当てている。
Zenn LLM ・ 2026-07-29
政治・選挙情報の中継者としてのLLMの応答品質や客観性を評価するフレームワーク「Polistemics」が提示されました。最新モデルであっても明確な証拠がない場合や情報が曖昧・矛盾している状況では体系的な誤りを起こすことが明らかになり、選挙情報におけるLLMの利用リスクが浮き彫りになりました。
arXiv cs.CL ・ 2026-07-28
自動運転などのAIシステムにおける、入力画像の品質低下が引き起こす認識エラーの課題が分析された。低品質な画像状況下でも最も致命的なエラーを回避するためのアプローチを確立することを目指している。
arXiv cs.CV ・ 2026-07-28
AI開発においてハルシネーションに耐えるシステム構築の難しさと、AIの「視界」を明示的に絞る重要性が解説されている。開発現場で直面するノイズ軽減の実例を通じて、精度の高い推論を行うための方策が示されている。
Zenn LLM ・ 2026-07-28
視覚的文書理解モデルにおいて、根拠領域をバウンディングボックスの座標で直接出力させる従来のインターフェースが誤認識の原因になっていることが指摘された。テキストの直接引用とレイアウトパーサーを組み合わせた言語ベースの形式を採用することで、根拠特定の正確性が著しく向上することが示された。
arXiv cs.CL ・ 2026-07-27
AIエージェントが適切なコンテキストなしに誤った回答を出力する「自信を持ったハルシネーション」の課題と対策を解説している。認定データやAIスキル、Tableau MCPを活用して回答の正確性を高める重要性を示している。
Salesforce Blog ・ 2026-07-25