「你睡覺,AI 幫你做研究」— 為什麼這句話讓整個 AI 圈都停下來看?
2026 年 3 月,Karpathy 丟出了一個 repo:autoresearch
三個檔案,沒有華麗的 UI,沒有複雜的 infra,但它在 X 上瞬間爆紅
原因有三層
第一層:Karpathy 效應 他是 OpenAI 早期成員、Tesla 自駕 AI 前負責人,他說「這個東西有意思」,整個圈子都會停下來看
第二層:敘事太強 「你睡覺,AI 幫你做研究」— 任何人都聽得懂,任何人都會心動
第三層,也是最重要的:它在預告一種新的工作方式
過去的 AI 工具是「幫你寫 code」— Copilot、ChatGPT、Claude,你下指令,它產出,你審核,互動是一來一回的
autoresearch 不一樣,它是「你設計規則,然後離開,讓 AI 自己跑」,互動變成了:設計一次,執行無限次
但是等等,原理到底是什麼?為什麼這麼簡單的東西能做到這件事?
三個檔案,一個迴圈
整個 autoresearch 只有三個核心檔案:
prepare.py — 資料準備、tokenizer、evaluation,鎖死,agent 不能碰
train.py — 模型架構和訓練邏輯,這是 agent 唯一可以改的檔案
program.md — 寫給 agent 的研究 SOP,告訴它怎麼跑、怎麼判斷、怎麼回退
工作流程就是一個迴圈:
沒有 RAG、沒有 vector database、沒有 multi-agent orchestration,一個迴圈,一個數字,一條 git 指令
就這樣
它抓住了 AI 最關鍵的特質
「就這樣」能有效,是因為 Karpathy 抓住了 agent 最本質的強弱項:
Agent 不怕重複,不會累,不會因為第 30 次失敗就想放棄
但 agent 怕的是:問題太大、沒有方向、不知道做得好不好、做錯了不知道怎麼退回來
autoresearch 的每一個設計決定,都在消除 agent 的弱點:
| Agent 的弱點 | autoresearch 怎麼解決 |
|---|---|
| 問題太大,不知道從哪開始 | 只能改一個檔案 |
| 不知道做得好不好 | 一個數字:val_bpb |
| 做錯了怕搞壞整個系統 | git reset 自動回退 |
| 需要人來判斷結果 | 數字比大小,程式自己判斷 |
| 做到一半要停下來問人 | NEVER STOP,不准問,不准停 |
每一項都極度簡單,但組合在一起,就創造了一個 agent 能高效運作的完美環境
這不是讓 AI 變聰明這是把問題變笨,笨到 AI 一定能處理
最反直覺的設計:靠 .md 驅動,不是 script
這是我覺得最值得談的地方
autoresearch 的核心控制邏輯不是寫在 Python script 裡,而是寫在 program.md — 一份 Markdown 文件
等等,.md 不就是文件嗎?寫文件能驅動 agent?
能,而且在某些場景下,比 script 還強
原因是:script 控制的是機器,md 控制的是 AI 的判斷力
# script 能做的事:
if profit_factor > best:
keep()
else:
discard()
Script 可以做條件判斷,但它做不到的是:
- 「如果改善很小但加了很多醜 code,不值得保留」
- 「跑超過 10 分鐘就 kill 掉,不要浪費時間」
- 「用完所有想法之後,重新讀一遍設定檔,試著組合之前接近成功的實驗」
- 「不要追噪音,profit_factor 差距 < 0.05 在 100 筆交易以下大概是隨機的」
這些全部寫在 program.md 裡,用自然語言
因為 LLM 讀得懂自然語言,你用自然語言告訴它判斷標準、策略方向、什麼該做什麼不該做,它就照著做
Script 是硬邏輯:if/else、loop、threshold Markdown 是軟邏輯:判斷力、優先級、trade-off、策略方向
兩者不是互相取代,而是各管一層:
| 層級 | 用什麼 | 管什麼 |
|---|---|---|
| 執行層 | Script | 跑訓練、讀數字、git 操作 |
| 決策層 | Markdown | 該不該保留、下一步試什麼、什麼叫「夠好」 |
那什麼時候該用哪個?我的經驗法則很簡單:邏輯確定、不需要判斷 → script,涉及 trade-off、需要 AI 自己決定下一步 → markdown,最強的組合是兩者一起用 autoresearch 就是這個組合的教科書範例
Karpathy 真正的洞見是:agent 時代,決策層比執行層更重要 而決策層用自然語言寫,比用程式碼寫更靈活、更強大
實戰:從卡在問答循環,到 42 輪全自動
我在學習量化交易的過程中,有一段時間完全卡住
不是卡在不會寫 code,是卡在跟 AI 的互動方式上
每次我想調整策略參數、切換訓練資料區間、換一組回測條件,都要跟 Claude 來回對話:「現在把 train period 改成這個」「幫我換一下這個參數」「結果不好,退回去」
問題是,很多操作我自己也說不清楚,像是「換一組資料看看效果」這件事,背後涉及到要改哪些設定、怎麼切期間、跑完怎麼比較 — 我腦中有個模糊的方向,但沒辦法每一步都精確描述
Claude 也不是不行,但它需要我每一步都講清楚,我講不清楚,它就停下來問,我解釋半天,它做出來不是我要的,然後再來一輪
這不是 AI 不夠聰明的問題,是互動模式的問題
之前的模式是指令式的:我必須一步步告訴它做什麼,每一步都壓在我身上 — 想下一個實驗方向、描述操作細節、判斷結果好壞、決定要不要回退,整個「想 → 溝通 → 執行 → 判斷」的循環,我是瓶頸
看完 autoresearch,我試了一件事:把同樣的設計模式套上去
我寫了一份 autobacktest-program.md,定義了:
- 唯一可以改的檔案(策略參數)
- 評估指標(profit_factor)
- 回退規則(沒進步就 git reset)
- 一句關鍵指令:NEVER STOP
然後啟動,去做其他事
回來的時候,它已經自己跑完 42 輪實驗,自己改參數、自己跑回測、自己判斷好壞、自己回退
我不再需要講清楚每一步了 因為 program.md 定義的不是「做什麼」,而是「搜索空間 + 評估標準 + 回退機制」,Agent 在這個框架裡自己探索,不需要我一步步指揮
過程中它做了幾個我沒預期到的判斷:
- 把滑價設為 0 時理論報酬很高,但它自己標記為 "unrealistic" 然後丟掉
- 某個策略只有 3 筆交易但 profit_factor 很高,它不信任,選了交易筆數更多的版本
- trailing exit 策略虧損嚴重,丟掉之後再也沒回去試
這些判斷不是寫在 script 裡的 if/else,是寫在 Markdown 裡的自然語言規則,Agent 讀懂了,然後照做了
要強調的是:這是學習過程中的回測實驗,不是真實交易,回測結果跟實際績效之間有很多變數 — 滑價、流動性、市場結構變化,都會讓回測數字在實盤中大打折扣,這個案例的重點完全不在利潤數字,而在於:一個之前卡在問答循環裡做不動的學習流程,用 autoresearch 的設計模式,變成了可以自動跑的閉環
從「我要一步步指揮 AI」到「我設計規則,AI 自己跑」— 這個轉變,才是真正的收穫
全自動不是靠工具,是靠設計
最近 OpenClaw(龍蝦)爆紅,號稱能讓 AI 自動操作你整台電腦 — 發 email、訂餐廳、管行程,它跟 Claude Code 這類開發者工具不同,面向的是一般人,操作範圍是整台電腦而不只是程式碼
但我觀察到一個現象:很多人連 Claude Code、Codex、Gemini 這些現有工具都沒好好用過,就急著要裝龍蝦
這有點像連目的地都還沒想清楚,就急著叫計程車,車再好,不知道要去哪,繞一圈還是回到原點
問題不在工具問題是你有沒有能力定義:AI 該做什麼、怎麼判斷好壞、做錯了怎麼退回來 這個能力不會因為換一個更強的工具就自動出現,autoresearch 的整個設計 — 一個檔案、一個指標、一條回退規則 — 就是在練這件事
先學會設計閉環,工具隨時能換,反過來,沒有設計能力,給你再強的工具也只是換一個地方不會用
天花板在哪裡?
autoresearch 很強,但它的天花板也很清楚:
它只能做局部優化,不能做突破性創新
它能在你定義的搜索空間裡找到最好的參數組合,但它不會質疑搜索空間本身是不是對的
用一個比喻:autoresearch 是一個極度勤奮的研究助理,能在你畫好的地圖裡把每個角落都搜過,但它不會說「等等,我們應該去另一張地圖」
天花板 = 你定義的搜索空間的上限
所以真正有價值的工作不是跑迴圈,而是:
- 定義對的問題
- 選對的指標
- 設計對的搜索空間
- 知道什麼時候該換地圖
這些,目前還是人的工作
結論:不是更強的模型,而是更好的迴圈
如果你問我 autoresearch 最值得帶走的一句話:
Agent 的威力不在於它有多像人,而在於你能不能把工作切成一個它可以持續獲得回饋的閉環
原理很簡單:一個檔案、一個指標、一條回退指令、一份 Markdown SOP
但這個簡單的結構,抓住了 AI 最核心的特質:不怕重複、不會累、不需要動力、只需要方向
給它一個夠小的空間、一個夠快的回饋、一條夠清楚的規則,它就能在你睡覺的時候,把你醒著做不動的事跑完
這不只適用於 AI 研究或量化回測,行銷、內容、測試、營運 — 任何能被框成「改變數 → 看指標 → keep/discard」的工作,都能用這個模式
未來有價值的,不只是更強的模型,而是更好的 feedback loop design
誰能把一件事切成 agent 能穩定跑的閉環,誰就比較有機會先拿到效率紅利
