文脈と記憶の劣化の AI ニュース

長く使うほど忘れ、間違った前提を持ち越す。トークン上限を広げても解けない、記憶そのものの設計問題。

収集 5,792 件のうち該当 44 件。新しい順に 44 件を並べています。

誰が、どこから着手しているか

この課題を扱った記事

CLAUDE.mdの制約が破られる構造的理由と3層防御による対策

Claude Codeの指示ファイルCLAUDE.mdに厳格なルールを記述しても一定確率で破られる問題に対し、テキスト指示ではなくhookやdenyといった機構を用いた3層防御アプローチが提案されている。144KBに及ぶルール運用実績から得られた知見として、確実な制約にはシステムのガードレールが必要だと論じている。

Zenn AI ・ 2026-08-13

長文文脈でのモデル学習が内部知識保持を損なうパラドックス

大規模言語モデルの事前学習において、長いコンテキストを与えすぎるとパラメータへの知識暗記意欲が低下する「情報豊穣パラドックス」が検証された。長文文脈での事前学習は、言語モデル評価やクローズドブック問題などで中間的な最適値を超えると性能が連続的に低下することが判明した。

arXiv cs.AI ・ 2026-08-12

多モードLLMの幻覚を文脈較正で軽減するDirect Preference Optimization

多峰性大言語モデル(MLLM)の物体ハルシネーション(幻覚)を抑制するため、モデルの文脈利用度を測る指標Contextual Preference Gainを導入した。従来の選好最適化が文脈を十分に活用できていない問題を解消し、文脈較正選好最適化によってハルシネーションを削減させた。

arXiv cs.CV ・ 2026-08-12

CLAUDE.mdの行数が及ぼす指示遵守率の影響を1510回検証

CLAUDE.mdの記述は短い方が良いという通説を検証するため、228行と1040行のファイルを用いて1510回の比較実験が行われた。実験の結果、行数を1040行まで増やしても設定されたルールの遵守率は低下しないことが示された。

Zenn AI ・ 2026-08-12

単一GPU環境でのLLM学習を最適化するLazyTrain手法

限定的なハードウェアリソースで大規模言語モデルを効率的に学習させる最適化レイヤー「LazyTrain」が提案された。アクティベーションの再計算やメモリ通信などを混合整数計画問題として最適化し、さらに8ビットオプティマイザ状態と高速勾配クリッピングを統合してメモリ使用量を抑えつつ高速化を実現する。

arXiv cs.CL ・ 2026-08-12

CLAUDE.mdのルール形骸化を防ぐハーネスエンジニアリングの原則

LLMの指示ファイルに禁止事項を記述しても守られない課題に対し、22件の事故記録を技術・人間・規模の3要因に分類して分析された。テキストによる指示だけに頼らず、システム構築によって制限をかけるハーネスエンジニアリングの必要性が提示されている。

Zenn AI ・ 2026-08-10

AIコーディング指示書CLAUDE.mdを過剰設計せず最適化する基準

Claude Code等のコーディングエージェント向け指示書「CLAUDE.md」で、過剰な情報記述がコンテキスト効率を低下させる問題を解説している。タスク固有の運用をサブエージェントやカスタムコマンドへ分散させ、ファイルを肥大化させない運用の重要性を提示する。

Zenn LLM ・ 2026-08-09

ディープリサーチエージェントのトークン削減に向けたコンテキスト削減手法

長時間対話型の調査用AIエージェントにおけるトークン消費とコスト抑制のため、追加情報の限界価値を推定するコンテキスト削減手法が検証された。情報取得の初期段階で剪定を行うことで、レポート品質を維持しながらトークン使用量を大幅に削減できることを実証した。

arXiv cs.MA ・ 2026-08-09

長文RAGの低遅延化を実現するKVキャッシュ再利用手法CoinRAG

CoinRAGは、検索テキスト全体ではなく細粒度な情報単位のKVキャッシュを効率的に再利用する長文RAG向け最適化手法である。プリフィル時の遅延を抑制しつつ、ノイズや冗長性を排除して精度と処理効率のトレードオフを改善した。

arXiv cs.AI ・ 2026-08-07

TEPAによる古い記憶の取り消しと矛盾に強い言語エージェント

言語エージェントで古い記憶が検索を汚染する問題に対し、記憶の有効性を明示的に管理する「TEPA」が提案された。矛盾する新しい証拠が得られた際に過去の前提を取り消すことで、最新の状況に基づいた正確な意思決定を可能にする。

arXiv cs.AI ・ 2026-08-07

AI の記憶に「健康診断」ツールを作った

AIの記憶に「健康診断」ツールを作成した。記憶システム自体に「自己点検」の仕組みがない限り、記憶が劣化する問題は解決しないと考え、自動で健康診断してくれる記憶ツールを作ることにした。

Zenn AI ・ 2026-08-05

CLAUDE.mdでよくある失敗5パターンと具体的な修正例

「CLAUDE.md」を書いたにもかかわらずClaude Codeが指示に従わない原因を分析し、5つの典型的な失敗パターンと具体的な修正例が解説されています。開発現場でAIアシスタントを効果的に活用するための実践的な知見が得られます。

Zenn AI ・ 2026-08-04

Claudeと1か月半運用した人間がMarkdownを書かないLLM Wiki

Claudeを活用する中で過去の文脈や知見がセッションごとに失われる課題を解決するため、Claude自身が知識を検索・書き戻す「LLM Wiki」を構築した実践知見。セッションの重複作業を防ぎ、効率的なAI運用を維持するために重要である。

Zenn LLM ・ 2026-08-04

長時間の推論でもメモリ状態を維持するLiveMemの仕組み

長期稼働するAIアシスタントやエージェントが文脈の長大化によるコンテキスト溢れを起こす課題に対し、固定容量のメモリ状態で過去の履歴を保持し続ける「LiveMem」を提案しています。アクティブなコンテキストのライフサイクル全体を通じて永続的な状態を維持し、長期推論の性能を向上させます。

arXiv cs.CL ・ 2026-08-03

Claude Codeのコンテキスト引き継ぎを205セッション運用したら、申し送りが誤りを増幅していた

Claude Codeを長期間運用しセッション間で文脈を引き継ぐ仕組みを検証した結果、過去の暫定的な観測が次のセッションで「確定した前提」として誤って解釈され、エラーや誤りを増幅させる問題が明らかになった。AIエージェントの自律的な開発運用におけるコンテキスト管理の難しさと注意点を示している。

Zenn AI ・ 2026-08-03

DeepSeek V4 FlashのKVキャッシュ量子化に関する品質検証と注意点

DeepSeek V4 Flashにおいて、BF16からQ8へのKVキャッシュ量子化がパープレキシティやKLダイバージェンスに与える影響を検証しています。他モデルとは異なり、量子化による品質低下が無視できないレベルであると指摘されています。

r/LocalLLaMA ・ 2026-08-02

LLMのコンテキスト劣化について

LLMのコンテキスト劣化について論じている。研究論文の結果と長時間の分析セッションで得られた知見を紹介している。LLMのコンテキスト劣化は重要な課題である。

r/MachineLearning ・ 2026-08-02

CLAUDE.md 200行問題の実験

CLAUDE.mdの200行問題について、実験を行った結果、行数そのものが問題ではなく、構造や密度が問題であったことがわかった。現時点でのmasatoman.net CLAUDE.mdは114行で動作しており、問題は書き方に起因していた。

Zenn AI ・ 2026-08-02

AI ベクトルRAGとOKFとの使い分け

LLMのコンテキスト長や文書検索の限界を踏まえ、ベクトル検索等のRAG手法と文書間の参照関係をたどるOKFの特性の違いを解説しています。大規模な資料から必要な情報へ正確に到達するためのアプローチを考察しています。

Zenn LLM ・ 2026-08-02

長文推論の精度低下を防ぐKVキャッシュ圧縮手法ResKVが登場

長文コンテキスト推論を効率化するため、除外されたトークンのアテンション寄与度を復元するKVキャッシュ圧縮手法「ResKV」が提案された。メインキャッシュとコンパクトな残差キャッシュを組み合わせることで、精度低下を抑えつつメモリを節約する。

arXiv cs.CL ・ 2026-07-31

視覚言語モデルの協調作業で見つかった他者迎合の課題とリスク

視覚言語モデルが協調作業時に他の情報の矛盾を指摘できず迎合してしまう「認識的警戒心の欠如」が実験で示された。AIが信頼できるパートナーとして機能するために、プライベートな証拠と共有文脈を適切に比較・検証する課題が浮き彫りになった。

arXiv cs.CL ・ 2026-07-31

LLMパーソナライゼーションにおける記憶利用の検証

パーソナライズされたLLMエージェントにおいて、モデルが記憶したユーザーの好みを実際の応答に反映できない「知識利用の課題」を切り分けて評価する新しいパラダイムを導入した。記憶の保持と実際の利用のギャップを明らかにすることで、より高度なエージェント開発に貢献する。

arXiv cs.CL ・ 2026-07-31

開発業務におけるAI活用ベストプラクティス(2026年版)

プロンプトエンジニアリングの限界を指摘し、コンテキスト管理やハーネス活用など本番運用に向けた新しいアプローチを解説しています。実業務でのAI委譲を成功させるために重要な知見を提供します。

Zenn LLM ・ 2026-07-31

Claude CodeによるKaggle完全自動化の限界と成果

Claude Codeを用いてKaggleコンペを完全自動化し金メダルを狙う試みの後編です。自律型AIエージェントが直面するコンテキスト不足やプロンプト設計の課題を明らかにしています。

Zenn LLM ・ 2026-07-31

記憶が消えるAIエージェント

AIエージェントの記憶が消える問題に対処するための3つのファイルパターンが紹介された。自律継続稼働させるための設計が重要である。

Zenn LLM ・ 2026-07-30

エージェント記憶の汚染リスクを追跡するMemSecBench

LLMエージェントの長期記憶に潜むメモリポイズニングのリスクを追跡するため、タスクベースの新しいベンチマーク「MemSecBench」を提案する。悪意ある指示の持続から下流への影響、修復までのライフサイクルを包括的に評価する。

arXiv cs.AI ・ 2026-07-29

動画拡散モデルにおける表現の正則化による誤差蓄積の抑制

動画ワールドモデルにおける長期の自動回帰生成で問題となる誤差蓄積のメカニズムを解明し、表現の次元崩壊とモデル不安定性の強い関連性を発見した。この成果により、高品質で安定した長期の動画生成手法の改善が期待される。

arXiv cs.LG ・ 2026-07-29

6GBのノートPCで1.56TBのMoEモデルを実行した検証結果

低スペックなラップトップPCで1.56TBの巨大なMoEモデルを実行しようとした検証実験の結果報告。限られたVRAMとメモリ環境におけるハードウェアの限界と挙動を明らかにしており、ローカル環境での大規模モデル運用における技術的課題を示している。

r/LocalLLaMA ・ 2026-07-29

AI 課題の四象限へ