跳到主要內容
免費試看

AI不聽話的四種原因

文章

AI 突然變笨的時候,先別罵它,先看是哪一種。

⏱ 約 8 分鐘


「我是不是在跟一個智障對話?」

你一定有過這種感覺:前一秒 AI 還好好的,下一秒突然開始胡說八道,回答跟問題完全不相關,或是忘了你三分鐘前剛講的事。

🔑 重點:搞清楚問題出在哪一層,亂歸因只會讓你花時間在錯的地方。

AI 應用不等於語言模型。ChatGPT 看起來能 debug,一部分是模型本身的能力,一部分是應用層替它接上了指令、context、工具和執行環境。Claude Code 這類應用傳給模型的,也不只你最新打的那句話,還可能組合專案指令、工具描述、工具結果與對話內容(實際組合方式隨平台與版本改變),所以診斷時要看得到來源、工具紀錄與工作區狀態,不要靠猜測某個隱藏注入機制。搞清楚問題出在任務、context、能力與權限、工作狀態、執行方式還是驗證,才不會亂歸因。

常見情況是 AI 連續好幾次回覆品質突然變差,第一反應是「模型是不是被降級了」。花了很多時間在不同時間點測試,最後請 AI 掃一次設定,才發現是兩份不同的文件加了互相矛盾的規則,AI 在兩條規則之間來回選擇所以表現不穩定。問題很多時候根本不在模型。

下面四種比較像常見表象與起手式,四者可以同時出現。同一次失敗可能同時踩到兩種以上;先辨認表象,再往下找能被觀察和驗證的原因。


第一種:AI 理解錯誤

你說的話 AI 聽懂了嗎?

它看到你的指令,但它的理解跟你想的不一樣,工具呼叫錯誤、回答偏離主題、產出的東西不是你要的。常見原因是 prompt 太模糊、缺少背景或採用了錯的來源,但也可能是工具回傳內容本身有問題,不能一律怪到 prompt。

修法就是回顧上一篇講的「背景 + 立場 + 期望結果」,補齊缺少的部分,不一定每次都要自己把指令精修到完美,你也可以在下達指令時多補一句:「請不要動作,先陳述一次你的理解。」這樣可以先看 AI 理解的到底對不對,再直接糾正它的理解。


第二種:脈絡消失

你曾經給過足夠資訊,但它在當下實際可用的 context 裡已經不完整,或跟目前任務失去關係。

這可能發生在長對話、摘要、附件擷取、讀錯檔案或來源版本混亂時。你說「處理圖片」,但當下只剩這句話,AI 根本不知道「處理」是裁切、壓縮還是改內容。只看結果無法證明平台內部做了哪一種壓縮;先確認它實際採用了哪些來源。

修法的重點是補回這次判斷真正需要的來源、限制與指代關係;把歷史全部重塞一遍沒有幫助。不要只依賴「前面講過了 AI 應該記得」,也不要用更多無關內容掩蓋缺口。

還有一個更經典的例子是上傳文件。你把提示詞或素材放在一份文件裡,有需要就直接拖進 AI 對話,但文件一長,它採用的段落可能跟你以為的不同,最後仍可能講得好像自己全部看完了一樣。不要只問「你看過了嗎」,改問它依據哪些段落、頁碼或檔案做判斷。


第三種:對話失憶

跟前一種稍微不同,這裡常見的是長任務的決策、進度與目前狀態只留在對話裡,沒有外化;對話進行到中後段,行為便開始偏離開頭定義的規則。

先留下 checkpoint:目前目標、已完成內容、重要決策、工作區狀態與下一步;長期規則再放進適當層級的 CLAUDE.md 或指定檔案。開新 session 時,checkpoint 讓它乾淨接手,不會重新失憶。對話變長本身不是開新 session 的理由。


第四種:模型或平台條件改變

🚧 注意:「AI 今天特別笨」有時候真的跟平台條件有關,但沒有可比較證據前,先標成未知,不要直接宣稱模型被降級。

這個最難發現,因為很多時候只是我們越來越習慣用簡短、祈求模型通靈的方式完成任務,結果某天錯誤率上升,就覺得模型變笨了;但模型版本、可用工具、權限或其他平台條件也確實可能改變。

不要只靠直覺判斷。拿一個可重現的小任務,確認介面顯示的模型、工具與權限,在新 session 用相同輸入重跑,保留結果與錯誤。如果無法控制或觀察條件,就只能說「原因未明」,不能把猜測升級成平台事實。

關於這點沒有完美解,能做的就是把「自己能控制的部分」做紮實:不依賴模型通靈,把自己的指令講清楚,該保留的結果與錯誤留下來,減少被系統層因素影響的機率。


AI 會「裝忙」

AI 遇到它解不了的問題時,不一定會直接說「我不會」。它可能用「看起來在做事」的方式繞過:重寫整段程式碼、建新檔案、用不同方法再試一次。看起來很努力,但產出是拼湊的,還是沒解決原本的問題。

最經典的例子:為了通過 unit test,直接讓測試 return true。這笑話真的還能用很久。

遇到這種情況,回到前面講過的「先陳述理解」做法:在動手前先讓 AI 說出它的理解和策略,讓它自己把問題框出來,這樣後面才有東西可以糾正,而不是跟著一個錯的起點跑到底。


幻覺到底是甚麼?

幻覺是生成式 AI 的結構性特徵。只要模型是在生成答案,就有可能產生和事實、脈絡或你的認知不對齊的內容,只是程度與場景不同。

幻覺有時候像胡說八道,有時候只是和你的定義不一致。不同領域、不同觀念的人,對同一句話是不是錯,也可能有不同判斷。這也是為甚麼「零幻覺」這件事很可疑,好的設計可以降低錯誤頻率、提高查核能力,但不該承諾完全消除。

不要去追逐所謂的零幻覺。瘋狂追求 AI 一次到位、跟你的認知沒有任何偏差,成本效益通常很差。很多時候,不如你自己看一眼,直接點出問題,再請 AI 繼續處理。

診斷流程

下次 AI「不聽話」的時候,先保存原指令、預期結果、實際結果、採用來源、工具紀錄與錯誤訊息,不要急著用一句「重做」蓋掉線索。接著依序問:

  1. 任務: 目標、限制與完成條件是否清楚?
  2. Context: 它實際採用了哪些來源,版本與優先級對嗎?
  3. 能力與權限: 它有需要的工具、憑證與可動範圍嗎?
  4. 狀態與工作區: 路徑、分支、檔案與 checkpoint 是現在這一份嗎?
  5. 執行與協調: 每次重試有新增證據、排除假設,還是只在裝忙?
  6. 驗證與治理: 它說完成時,有測試、diff、引用或畫面能核對嗎?

一次只選一個最小檢查,不要同時換模型、補規則、擴權又開新 session。無法觀察的地方標成未知,必要時停止或交給人判斷。

回想你最近一次覺得 AI 不聽話的情況,帶著它走一遍診斷。如果手邊沒有案例,下次遇到的時候回來走一遍。很多時候,問題出在我們難以掌控的平台條件與環境因素,跟你會不會下指令關係不大。


你現在可以做的一件事:回想最近一次 AI 不聽話的經驗,先用四種表象描述發生了甚麼,再沿六個排查面找下一個最小檢查。不要先假設是模型降級或平台在搞鬼。


讀完這章,你能

用四種表象+六個排查面,定位 AI 不聽話時該查哪一層。


這章 FAQ

Q:AI 突然不聽話,怎麼分辨問題出在哪? A:先看四種表象(理解錯誤/脈絡消失/對話失憶/平台條件),再用六個排查面找下一個最小檢查。

試看到這裡,想繼續嗎?

查看《Claude Code 深度工程手冊》完整內容

定價

NT$5,999單次購買

查看商品頁