讀完 Karpathy 的 llm-wiki (1):AI 記憶不會自己過期,它會安靜地幫你做錯決定
AI 開發實踐·10 分鐘

讀完 Karpathy 的 llm-wiki (1):AI 記憶不會自己過期,它會安靜地幫你做錯決定

Karpathy 的 llm-wiki 引爆知識庫實作潮。Lex Fridman 用 ephemeral wiki 準備 podcast,用完就刪。我用同樣的概念管理企業專案一年半,但我的版本多了一件事:驗證。因為過時的知識不會消失,它會讓你很有信心地做錯決定

Y
Young Tsai

先講 Karpathy 說了什麼

Andrej Karpathy —— OpenAI 共同創辦人、Tesla 前 AI 負責人、「vibe coding」這個詞的發明者 —— 4 月初發了一個 idea file 叫 llm-wiki

他觀察到自己用 AI 的方式在改變:以前主要是叫 AI 寫程式碼,現在越來越多 token 花在整理知識上

所以他提出一套架構:

  • raw/:原始素材丟進來(論文、文章、網頁截取),不改動
  • wiki/:AI 讀完 raw 之後,編譯成結構化的知識頁面。一篇新素材可能觸及 10-15 個 wiki 頁面
  • schema/:設定檔,告訴 AI 怎麼運作(像 CLAUDE.md)

三個操作:Ingest(把新素材編譯進 wiki)、Query(查詢 + 回灌新知)、Lint(品質檢查,抓矛盾和過時資訊)

核心概念一句話:知識編譯一次,持續更新,不要每次重新推導

Karpathy 自己只發了概念,沒有做實作,刻意讓社群去建。兩天內 GitHub 冒出十幾個實作,84 個工具被整理成 awesome list

後來他又補了一則推文,講了一個更大的觀點:在 agent 時代,分享的不是 app,是 idea file —— 你把想法寫下來,對方的 agent 會根據自己的需求去客製化和建構。不需要分享程式碼,因為每個人的場景不同,agent 會幫你長出適合你的版本

這個框架啟發了很多人,也啟發了我。我的場景是接案顧問,同時管十幾個專案,所以在他的基礎上延伸出另一種做法 —— 從每次踩坑裡長出規則,從每次被客戶問倒裡長出 SOP,跑了一年半,累積成一套系統。同一個概念,在不同的土壤上會長出不同的東西

同一個概念,不同人拿來做的事完全不同。其中最讓我意外的是 Lex Fridman —— 他拿 Karpathy 的架構做了一件跟我完全相反的事


Lex 怎麼用 Karpathy 的架構:用完就丟

根據 VentureBeat 的報導,Lex 把 Karpathy 的 raw → wiki 架構用在 podcast 準備上

他錄 podcast 之前,會讓 AI 去爬來賓相關的資料 —— 論文、推文、爭議、技術背景,compile 成結構化的 markdown

然後他去跑步,戴著耳機,用 voice mode 跟這個知識庫對話。跑完回來,對題目有感覺了

那個知識庫?刪掉

他管這叫 ephemeral wiki —— 為一個任務而生,任務結束就消失

這招很聰明 —— 沒有維護成本,每次都是乾淨的起點


我的做法:留下來

我用 Claude Code 管超過 15 個專案跟開發,每天都在用,連續一年半

我的知識不是為了一次訪談準備的。是從 bug 裡、從客戶會議裡、從每次搞砸之後的檢討裡長出來的

真實場景:

三個月前我在一個醫療專案踩了一個坑 —— 部署完說「上線了」,但沒有實際 curl URL 確認,結果 404。之後我加了一條規則:說完成之前必須附證據

三個月後,我在一個教育專案也要部署。AI 又想說「部署完成」就收工。但因為那條規則還在,它被擋住了,乖乖跑了驗證

這不是 session recovery 能解決的 —— /catchup 可以接續上一個 session,但它不會記得三個月前另一個專案的教訓

跨專案、跨時間的知識,才需要 memory 系統


真正的差別不是存不存,是驗不驗

Karpathy 的原文提到三個操作:Ingest(吃素材)、Query(查詢)、Lint(品質檢查)

大多數人做了前兩個就停了。建個 wiki,能查就好

我多做了一步:驗證

我寫了一個品質檢查工具,會掃描所有知識檔案:

🔴 嚴重

  • 待辦事項的日期已經過了,但還沒打勾
  • 索引表寫的摘要跟檔案實際內容矛盾

🟡 警告

  • 有檔案存在但索引漏掉了
  • 檔案超過 30 天沒更新,但裡面寫著「進行中」

第一次跑的結果:4 個嚴重問題、12 個警告、10 個格式建議

其中一個:有個待辦標注「進行中」,但其實早就結束了,結果從來沒寫回去

沒有這個檢查的話,過時資訊會一直躺在那裡。下一次 AI 會根據這個錯誤的記憶給建議 —— 而且它會講得很有信心


Hooks:不靠 AI 記得,靠程式強制

除了品質檢查,我還有一層叫 hooks

Hooks 不是建議,是強制。程式碼層級的閘門

比如:AI 說「完成了」但沒附證據(截圖、實際回應、測試結果),hook 直接擋住

92 個 session 的數據:這個 hook 被觸發了 516 次。超過一半的 session 都有 AI 想說完成但其實沒驗證

再比如:如果超過 7 天沒整理知識庫,session 開始時自動提醒。不靠 AI 記得 —— 是一段程式去讀日誌算天數

Lex 不需要這些。他的知識庫不會活過一天,壞了也沒差

我的要活幾個月。不驗證的話,你不是在累積知識 —— 你是在累積對過時資訊的信心


但內部驗證不夠

品質檢查和 hooks 是我自己看的指標。如果只有這些,我跟社群上分享「我的 AI workflow」的人沒有差別 —— 都是自己覺得好用

所以我對自己多了一個要求:系統好不好用,不是我說了算,是付錢的人說了算

這不是在要求別人也這樣。學 AI 有很多原因,好玩也是好理由

但我是拿這套系統在接案吃飯的

目前:超過 15 個專案跟開發同時跟我合作,橫跨醫療、教育、長照、職涯。這些全部是在正職下班後、睡前的空擋處理的 —— 系統打造好之後,很多任務接近自動化,我睡覺時 AI 也在跑。不用 Notion 不用 Trello,靠 Claude Code + GitHub 跑完

客戶不知道我背後有什麼工具。他們只知道東西交得出來、品質穩定、回應快

這才是真正的品質檢查 —— 市場每個月幫你做一次健檢,不續約就是不及格


回到 Karpathy

讀那個 idea file 的時候,我的反應不是「我要去做這個」

是「這就是我在做的事」

他從概念出發,我從問題出發。他的 idea file 很乾淨,我的系統到處都是搞砸後留下的補丁。但他寫的每一個操作,我都已經在跑了

我後來想通一件事:真正能滿足你需求的系統,是養出來的,不是複製別人的。但養的過程中,你可以把別人的做法提煉出來,加到自己身上。Karpathy 給了我語言,但系統是我自己長出來的

他那句話真正的意思:

Knowledge compiled once, kept current, not re-derived on every query

重點不是 compiled

重點是 kept current

而 kept current 需要驗證。不然就是編譯了一次,然後慢慢腐爛


下一篇:我的系統長什麼樣 — 六層架構、四個工具、分散式管理、以及還沒解的問題

claude-codekarpathyllm-wikiknowledge-managementlex-fridmanmemory-system