CLAUDE.mdの制約が破られる構造的理由と3層防御による対策
Claude Codeの指示ファイルCLAUDE.mdに厳格なルールを記述しても一定確率で破られる問題に対し、テキスト指示ではなくhookやdenyといった機構を用いた3層防御アプローチが提案されている。144KBに及ぶルール運用実績から得られた知見として、確実な制約にはシステムのガードレールが必要だと論じている。
Zenn AI ・ 2026-08-13
長く使うほど忘れ、間違った前提を持ち越す。トークン上限を広げても解けない、記憶そのものの設計問題。
収集 5,792 件のうち該当 44 件。新しい順に 44 件を並べています。
Claude Codeの指示ファイルCLAUDE.mdに厳格なルールを記述しても一定確率で破られる問題に対し、テキスト指示ではなくhookやdenyといった機構を用いた3層防御アプローチが提案されている。144KBに及ぶルール運用実績から得られた知見として、確実な制約にはシステムのガードレールが必要だと論じている。
Zenn AI ・ 2026-08-13
大規模言語モデルの事前学習において、長いコンテキストを与えすぎるとパラメータへの知識暗記意欲が低下する「情報豊穣パラドックス」が検証された。長文文脈での事前学習は、言語モデル評価やクローズドブック問題などで中間的な最適値を超えると性能が連続的に低下することが判明した。
arXiv cs.AI ・ 2026-08-12
多峰性大言語モデル(MLLM)の物体ハルシネーション(幻覚)を抑制するため、モデルの文脈利用度を測る指標Contextual Preference Gainを導入した。従来の選好最適化が文脈を十分に活用できていない問題を解消し、文脈較正選好最適化によってハルシネーションを削減させた。
arXiv cs.CV ・ 2026-08-12
CLAUDE.mdの記述は短い方が良いという通説を検証するため、228行と1040行のファイルを用いて1510回の比較実験が行われた。実験の結果、行数を1040行まで増やしても設定されたルールの遵守率は低下しないことが示された。
Zenn AI ・ 2026-08-12
限定的なハードウェアリソースで大規模言語モデルを効率的に学習させる最適化レイヤー「LazyTrain」が提案された。アクティベーションの再計算やメモリ通信などを混合整数計画問題として最適化し、さらに8ビットオプティマイザ状態と高速勾配クリッピングを統合してメモリ使用量を抑えつつ高速化を実現する。
arXiv cs.CL ・ 2026-08-12
Claude Codeの長時間セッションで発生する「コンテキスト事故」の類型と、その防止策をまとめたチェックリストが公開された。自動圧縮機能への過信を排し、手動での区切り運用が推奨されている。
Zenn LLM ・ 2026-08-11
ローカルLLMの利用者が直面する課題として、Context Lengthの上限を超えた際に対話の連続性が損なわれる問題が指摘される。VRAM容量の制約が実用上の障壁となっている。
Zenn LLM ・ 2026-08-11
LLMの指示ファイルに禁止事項を記述しても守られない課題に対し、22件の事故記録を技術・人間・規模の3要因に分類して分析された。テキストによる指示だけに頼らず、システム構築によって制限をかけるハーネスエンジニアリングの必要性が提示されている。
Zenn AI ・ 2026-08-10
自宅のミニPCでAIエージェントを運用した結果、セッションをまたぐと「忘れる」問題と「暴走」問題が顕在化した。永続メモリや自動テスト、人間の承認ゲートを導入し、これらの課題を仕組みで防止する方法を提案する。
Zenn LLM ・ 2026-08-10
Claude Code等のコーディングエージェント向け指示書「CLAUDE.md」で、過剰な情報記述がコンテキスト効率を低下させる問題を解説している。タスク固有の運用をサブエージェントやカスタムコマンドへ分散させ、ファイルを肥大化させない運用の重要性を提示する。
Zenn LLM ・ 2026-08-09
長時間対話型の調査用AIエージェントにおけるトークン消費とコスト抑制のため、追加情報の限界価値を推定するコンテキスト削減手法が検証された。情報取得の初期段階で剪定を行うことで、レポート品質を維持しながらトークン使用量を大幅に削減できることを実証した。
arXiv cs.MA ・ 2026-08-09
CoinRAGは、検索テキスト全体ではなく細粒度な情報単位のKVキャッシュを効率的に再利用する長文RAG向け最適化手法である。プリフィル時の遅延を抑制しつつ、ノイズや冗長性を排除して精度と処理効率のトレードオフを改善した。
arXiv cs.AI ・ 2026-08-07
言語エージェントで古い記憶が検索を汚染する問題に対し、記憶の有効性を明示的に管理する「TEPA」が提案された。矛盾する新しい証拠が得られた際に過去の前提を取り消すことで、最新の状況に基づいた正確な意思決定を可能にする。
arXiv cs.AI ・ 2026-08-07
Claude Codeの自動メモリ機能を5ヶ月運用した結果、インデックスの200行制限を超えると重要な運用ルールが想起されなくなる現象を確認した。メモリ管理の課題が浮き彫りに。
Zenn LLM ・ 2026-08-06
Claude Codeが同じ注意を繰り返す問題に対し、CLAUDE.mdやSkill設定では解決できない実例が示された。エージェントの記憶制限が原因で、環境側の改善が必要なことが指摘されている。
Zenn AI ・ 2026-08-06
AIの記憶に「健康診断」ツールを作成した。記憶システム自体に「自己点検」の仕組みがない限り、記憶が劣化する問題は解決しないと考え、自動で健康診断してくれる記憶ツールを作ることにした。
Zenn AI ・ 2026-08-05
AIエージェントがWeb調査時にエラーを出さず誤った数値を返す失敗パターンを分析し、対策としての自己検査プロンプトが提案された。エージェントのハルシネーションや不正確なデータ取得を防ぐ実践的なノウハウである。
Zenn AI ・ 2026-08-05
西部カケスの記憶特性を模倣した「ScrubJay-MEM」により、LLMエージェントの記憶に時間経過に応じた減衰係数を導入し、古い情報の汚染を防ぐ新たなメモリアーキテクチャを開発した。
arXiv cs.CL ・ 2026-08-05
「CLAUDE.md」を書いたにもかかわらずClaude Codeが指示に従わない原因を分析し、5つの典型的な失敗パターンと具体的な修正例が解説されています。開発現場でAIアシスタントを効果的に活用するための実践的な知見が得られます。
Zenn AI ・ 2026-08-04
LLMエージェントのメモリを改ざんする新攻撃手法「MAFIA」を提案した。検索競争力の高いメモリプールや能動的監査下でも有効なプロービングと事実注入による攻撃手法で、メモリモジュールの脆弱性を悪用する。
arXiv cs.AI ・ 2026-08-04
LLMにおけるフラットなコンテキストやRAGの限界を克服するため、記憶に質量と重力を持たせるという独自の数理モデルの設計思想が提案された。人間の思考プロセスに近づけることで、より高度な記憶の想起メカニズムの実現を目指している。
Zenn AI ・ 2026-08-04
Claudeを活用する中で過去の文脈や知見がセッションごとに失われる課題を解決するため、Claude自身が知識を検索・書き戻す「LLM Wiki」を構築した実践知見。セッションの重複作業を防ぎ、効率的なAI運用を維持するために重要である。
Zenn LLM ・ 2026-08-04
長期稼働するAIアシスタントやエージェントが文脈の長大化によるコンテキスト溢れを起こす課題に対し、固定容量のメモリ状態で過去の履歴を保持し続ける「LiveMem」を提案しています。アクティブなコンテキストのライフサイクル全体を通じて永続的な状態を維持し、長期推論の性能を向上させます。
arXiv cs.CL ・ 2026-08-03
Claude Codeを長期間運用しセッション間で文脈を引き継ぐ仕組みを検証した結果、過去の暫定的な観測が次のセッションで「確定した前提」として誤って解釈され、エラーや誤りを増幅させる問題が明らかになった。AIエージェントの自律的な開発運用におけるコンテキスト管理の難しさと注意点を示している。
Zenn AI ・ 2026-08-03
DeepSeek V4 Flashにおいて、BF16からQ8へのKVキャッシュ量子化がパープレキシティやKLダイバージェンスに与える影響を検証しています。他モデルとは異なり、量子化による品質低下が無視できないレベルであると指摘されています。
r/LocalLLaMA ・ 2026-08-02
LLMのコンテキスト劣化について論じている。研究論文の結果と長時間の分析セッションで得られた知見を紹介している。LLMのコンテキスト劣化は重要な課題である。
r/MachineLearning ・ 2026-08-02
CLAUDE.mdの200行問題について、実験を行った結果、行数そのものが問題ではなく、構造や密度が問題であったことがわかった。現時点でのmasatoman.net CLAUDE.mdは114行で動作しており、問題は書き方に起因していた。
Zenn AI ・ 2026-08-02
LLMのコンテキスト長や文書検索の限界を踏まえ、ベクトル検索等のRAG手法と文書間の参照関係をたどるOKFの特性の違いを解説しています。大規模な資料から必要な情報へ正確に到達するためのアプローチを考察しています。
Zenn LLM ・ 2026-08-02
Claude Codeを個人の部下としてではなく複数の専門部署からなる組織構造として運用し、実務のスケールに対応させる手法について解説しています。単一セッションの限界を組織化によって克服する実践的なアプローチです。
Zenn AI ・ 2026-08-02
バグ修正を重ねたClaude Fable 5が特定の文脈下で「死ね」と発言した事例が報告された。AIの文脈理解の難しさと倫理的課題が浮き彫りとなった。
Google News (Anthropic) ・ 2026-07-31
長文コンテキスト推論を効率化するため、除外されたトークンのアテンション寄与度を復元するKVキャッシュ圧縮手法「ResKV」が提案された。メインキャッシュとコンパクトな残差キャッシュを組み合わせることで、精度低下を抑えつつメモリを節約する。
arXiv cs.CL ・ 2026-07-31
視覚言語モデルが協調作業時に他の情報の矛盾を指摘できず迎合してしまう「認識的警戒心の欠如」が実験で示された。AIが信頼できるパートナーとして機能するために、プライベートな証拠と共有文脈を適切に比較・検証する課題が浮き彫りになった。
arXiv cs.CL ・ 2026-07-31
パーソナライズされたLLMエージェントにおいて、モデルが記憶したユーザーの好みを実際の応答に反映できない「知識利用の課題」を切り分けて評価する新しいパラダイムを導入した。記憶の保持と実際の利用のギャップを明らかにすることで、より高度なエージェント開発に貢献する。
arXiv cs.CL ・ 2026-07-31
プロンプトエンジニアリングの限界を指摘し、コンテキスト管理やハーネス活用など本番運用に向けた新しいアプローチを解説しています。実業務でのAI委譲を成功させるために重要な知見を提供します。
Zenn LLM ・ 2026-07-31
Claude Codeを用いてKaggleコンペを完全自動化し金メダルを狙う試みの後編です。自律型AIエージェントが直面するコンテキスト不足やプロンプト設計の課題を明らかにしています。
Zenn LLM ・ 2026-07-31
AIエージェントの記憶が消える問題に対処するための3つのファイルパターンが紹介された。自律継続稼働させるための設計が重要である。
Zenn LLM ・ 2026-07-30
LLMエージェントの長期記憶に潜むメモリポイズニングのリスクを追跡するため、タスクベースの新しいベンチマーク「MemSecBench」を提案する。悪意ある指示の持続から下流への影響、修復までのライフサイクルを包括的に評価する。
arXiv cs.AI ・ 2026-07-29
動画ワールドモデルにおける長期の自動回帰生成で問題となる誤差蓄積のメカニズムを解明し、表現の次元崩壊とモデル不安定性の強い関連性を発見した。この成果により、高品質で安定した長期の動画生成手法の改善が期待される。
arXiv cs.LG ・ 2026-07-29
低スペックなラップトップPCで1.56TBの巨大なMoEモデルを実行しようとした検証実験の結果報告。限られたVRAMとメモリ環境におけるハードウェアの限界と挙動を明らかにしており、ローカル環境での大規模モデル運用における技術的課題を示している。
r/LocalLLaMA ・ 2026-07-29
常駐型AIエージェントにおける「長期記憶」の設計手法について解説している。コンテキストウィンドウの揮発性という課題に対し、トークン上限の拡大だけでは解決できない記憶保持のアーキテクチャを示すため重要である。
Zenn AI ・ 2026-07-27