LLM 記憶壓縮實戰:滑動視窗 vs 摘要記憶,用答對率與 Token 成本量化取捨
本章節要實作滑動視窗與摘要壓縮兩種記憶,並用事實問答量化「省 token vs 記得住」的取捨
一、滑動視窗記憶
urscos Tech.
本章節要實作滑動視窗與摘要壓縮兩種記憶,並用事實問答量化「省 token vs 記得住」的取捨
一、滑動視窗記憶
SlidingWindowMemory,並驗證在 Context Window 中「忘掉久遠的事」一、大模型沒有記憶
由於 LLM 本質上是無狀態的(Stateless)。每一次 API 呼叫都是獨立的、全新的計算過程,模型內部不會保留任何「記住上一句話」的狀態。因此,兩次呼叫彼此獨立,第二次完全不知道第一次發生過的事情。於是乎就有了以下的做法。
把「歷史聊天記錄」+「當前新問題」打包拼接,作為一個完整的 Prompt 一次性傳給模型,讓它在 單次推理中 看到全部上下文。
Context Engineering(上下文工程):重點不是單句 prompt,而是 「在有限 context window 裡,放對的範例、對的格式說明、對的歷史」。
這篇延續上一個 CodeGraph 的深度解析數據庫

在上一篇文章CodeGraph 安裝與使用教學:整合 Claude Code、Cursor、Codex 的程式碼圖譜工具中資料如下:
(py3.10) D:\Git\mitagent>codegraph status
CodeGraph Status
Project: D:\Git\mitagent
Index Statistics:
Files: 25
Nodes: 423
Edges: 982
DB Size: 1.26 MB
Backend: node:sqlite - built-in (full WAL)
Journal: wal
在大型程式項目中通常會透過不同手段來優化 llm token 的使用效益,本篇文章將介紹如何使用 codegraph
安裝 CLI
npm install -g @colbymchenry/codegraph
進入到項目中,安裝 codegraph,它會自動偵測並設定 Claude Code、Cursor、Codex
$ codegraph install