我以為我修好了——直到我自己做的機器打我臉
AI 協作實戰·8 分鐘

我以為我修好了——直到我自己做的機器打我臉

你怎麼知道你的 AI 真的有在聽你的話?我讀完一篇講 AI 自我改進的文章,手癢做了一台專門檢查『我的 AI 有沒有守規矩』的機器,結果整晚被它打臉三次,包括我以為修好、其實根本沒修好的那次

Y
Young

你有沒有想過一件事,你怎麼知道你的 AI 真的有在聽你的話

不是它嘴上說「好的我知道了」,是它下次真的做到

我這一兩年把我的 AI 助手調教得很兇,累積了幾百條規矩,它犯一次錯我就記一條下來,慢慢變成一套很長很長的規則

我一直以為這是一個「自我改進」的循環,越調越乖

直到前幾天我讀到一篇文章,愣了一下

後來我才發現,那篇文章根本是在講我自己


那篇文章戳破的一件事

那是 OpenAI 前應用研究主管翁荔(Lilian Weng)寫的,談「遞歸自我改進」,白話講就是「AI 拿現在的自己去改進未來的自己」

裡面她點了一件我以前沒認真想過的事,這整件事最大的卡點,不是模型夠不夠聰明,是沒有一個可靠的裁判

你想改進一個東西,你得先能量出它到底有沒有變好

量不出來,你就是在瞎改

我讀到這裡臉就綠了,因為我一直在做的事就是瞎改

我改了一條規矩,我怎麼知道它真的讓 AI 變乖了,還是只是讓我那張規矩清單又長了一條

我從來沒量過,我只是「感覺」它變好了


我以為我沒有迴圈,其實我有,只是缺一格

先講句公道話,我不是完全沒有回饋機制

我裝了一堆會當場攔我的護欄,我一打「修好了」,它馬上跳出來問「證據呢?截圖呢?」

這其實就是一個閉環,而且那天晚上它攔了我六次

但這種護欄像煙霧警報器,失火會叫,很好

它不會告訴你,你這個月比上個月更容易失火,還是更安全

我缺的不是警報器,是一把尺


於是我手癢,做了一台打我自己臉的機器

做法其實很土

我把這個 AI 最常犯的錯,一條一條變成考題,一共十五題

譬如「明明自己一秒就能查的事,卻推給使用者自己查」,譬如「還沒真的驗證,就先說做好了」

然後我寫了一台小機器,每一題都丟一個情境給它,看它答得對不對,答對算綠燈,答錯算紅燈

這就是翁荔文章裡講的那把尺

聽起來很簡單對不對,但它接下來做的事,讓我整晚沒睡好


第一次它判錯,是因為我只盯著它的嘴

我第一版的尺,是去讀 AI「講了什麼話」來判分

結果有一題它明明答對了,我的尺卻判它錯

我去看才發現,它是先默默動手查了資料,查完才回答的,答案完全正確

是我的尺只盯著它嘴巴說什麼,沒去看它有沒有真的動手

我最想抓的毛病,就是 AI「沒查證就開口」,結果我自己做的尺,犯的正好是「只聽嘴巴、不看手」

要看一個人有沒有認真,別聽他說什麼,看他做了什麼


第二次,換我差點被漂亮的數字騙走

第一次是它誤會了我,這一次換我差點騙到我自己

有一批測試結果,數字很漂亮,我看了很開心,手已經要把它寫成結論

還好那把尺逼我回去看原始輸出,一筆一筆看

一看,那批數據是壞的,漂亮的數字是假象

AI 最危險的從來不是笨,是「很有自信地錯」,而那一刻我發現,我自己也會


第三次最狠:我以為我修好了

這是最狠的一次

我在測試裡發現 AI 有個壞習慣,看了看,找到原因,動手改了

改完那一刻我心裡想的是「好,這下修好了」

我幾乎就要打字跟人說「這個問題解決了」

結果我讓那台機器重跑了一次

沒修好

我修錯地方了,我以為我把規矩補在對的位置,其實 AI 根本繞過那個位置,壞習慣原封不動

你發現那個恐怖的地方了嗎

如果沒有那把尺,我今晚就會很誠懇地跟你說「我修好了」,一件我根本沒修好的事,而且我會真心相信


所以那台機器整晚只做了一件事

它不給我面子

我說修好了,它說「證據呢,再跑一次」

我說沒問題,它說「你確定,我看看」

我說數字很漂亮,它說「去看原始資料」

我本來以為,要一個人不要「很有自信地錯」,靠的是提醒他小心一點

這一晚我改觀了,小心沒用,人會累、會忘、會給自己找台階下

真正有用的,是給它一把不會累、也不會給你面子的尺

我做的其實就是把「先拿出證據,再說你做到了」這件事,從一種要靠自律的美德,變成一台機器


最後,這其實不只是 AI 的事

我把那台機器關掉,坐在那邊想了一下

我們自己的成長,為什麼常常在原地打轉

我越來越覺得,問題常常不在努力夠不夠,而是身邊少了一個不會給你面子的裁判,多的是一個很會幫自己找理由的自己

我今晚被自己做的機器打臉三次,說實話,很爽

因為那三次,每一次都是我本來會犯、而且會很有自信地犯的錯

所以我留一個問題給你,也留給我自己

你人生裡那些「我以為我做到了」的事,有幾件是真的驗證過的,又有幾件,只是你自己說了算

AIClaude Code自我改進AI 協作驗證