AI 最容易被評估的指標是第一個結果:答案快不快、程式能不能跑、信件看起來專不專業。但一次順利交付,無法回答更重要的問題:幾週後,誰還能判斷答案對不對?誰還記得自己做過的取捨?輸入到工具裡的資料又會留下在哪裡?

AI Guides 的〈Second-order thinking for people who use AI every day〉把這個問題叫做二階思考:一階問題是「會發生什麼」,二階問題是「因為它發生了,接著會怎樣」。把它放進 AI 工作,不是要求少用工具,而是要求在接受輸出前,把長期效果也放進驗收條件。

另一個更貼近「認識自己」的提問,是:工具讓人更能採取行動,還是只更相信一個現成標籤?歸淮的原始貼文把 MBTI、星盤與術數放在這個張力裡。這不是它們一概無效的證明;Forer 的實驗只說明,人很容易把寬泛的人格描述當成高度個人化的判斷。Forer, 1949 這正是把測驗結果當成假說,而不是身份判決的理由。

福柯在〈Technologies of the Self〉區分「照看自己」與「認識自己」:書寫、默想、審查、揭示與聆聽等實作的價值,不是替人取得一個永久標籤,而是改變自己如何檢查與行動。這是本文的延伸解讀:任何自我理解工具若不能指出下一個可驗證的行動,便不該取得替你定義自己的權力。

先分清楚:這次是在交付,還是在累積能力?

同一份模型輸出,放在不同任務裡,二階效果會完全不同。

任務類型可以優先最佳化不可省略的摩擦
一次性、低風險交付速度與格式抽查結果是否符合需求
需要專業判斷的決策候選方案與反例人類寫出取捨與最後理由
正在學習的技能解釋、提示與回饋先嘗試,再看答案;要求逐步引導
含敏感或客戶資料最小化輸入確認資料範圍、保存與分享設定

這個區分解決一個常見誤會:AI 不是必須讓人「親手做完」。如果任務的價值只在交付物,讓工具完成合理;若任務同時是培養判斷力或理解的練習,直接拿走完成答案,才是在借用未來的能力。

例如,臨時整理一份公開會議摘要,可以直接讓 AI 先產出草稿,再核對原始來源。相反地,架構選型、事故復盤、程式碼審查與重要客戶回覆,真正的成果不只是文字;還包括能說明「為何這樣選」的人。這些任務應要求人類保留決策紀錄、證據與反例,而不是只看模型結論是否流暢。

研究指向的是使用方式,不是工具名稱

現有研究不足以支持「AI 一定讓人退步」這種大結論,但足以讓團隊把風險當成設計問題。

Microsoft Research 與 Carnegie Mellon 的 CHI 2025 問卷收集了 319 位知識工作者的 936 個真實 AI 工作案例。它衡量的是受訪者自述的批判思考行為,並非長期因果實驗;在這個限制下,結果仍值得注意:對 AI 的信心較高,與較少的批判思考相關;對自己完成任務的信心較高,則與較多批判思考相關。研究頁面也指出,工作重心會從直接完成任務,移向驗證資訊、整合輸出與承擔任務責任。

因此,檢查不是 AI 工作流的收尾動作,而是主要工作。若驗證品質沒有跟著自動化提升,團隊只是把「寫出初稿」變快,卻把錯誤的發現延後。

另一項 2025 年發表的研究以 666 名受訪者的問卷與訪談,觀察到頻繁使用 AI 與較低的批判思考分數相關,而認知卸載是其中的中介因素。這同樣是相關研究,不能推論使用頻率直接造成能力下降;它比較實用的提醒是:把思考預設交給工具,會形成可重複的習慣。原始論文應被當成風險訊號,而非使用 AI 的禁令。

相反方向也有例子。Harvard 對 194 位物理課學生的初步比較發現,經過課程設計的 AI tutor 組學習增益約為傳統課堂組的兩倍;關鍵不是「給出答案更快」,而是 tutor 的設計與課程節奏。研究團隊說明仍指出結果尚待正式發表,但它清楚說明:把 AI 設計成鷹架,與把 AI 設計成答案販賣機,是兩種不同產品。

若要把這個原則落成日常做法,可接著使用六步 AI 學習閉環:它把目標、教材、練習、閉卷驗證與跨對話進度拆成可檢查的狀態。

把「然後呢?」放在 Prompt 之前

不需要另建一套治理委員會。一個足夠小的檢查,可以在送出 Prompt 前回答四句話:

這次輸出的用途是交付,還是要培養判斷?
如果我直接接受它,哪一項能力或責任會被跳過?
我如何用原始資料、測試或另一位 reviewer 證明它可靠?
這些輸入是否應該離開目前的資料邊界?

前兩題決定要不要保留人類先做的步驟;第三題把驗收改成可觀察的證據;最後一題處理資料,不把「聊天很方便」誤當成資料的生命週期很短。以 ChatGPT 為例,官方對共享連結的說明明確提醒:個人帳號的分享連結只要持有者可存取就能查看,且不提供逐一指定收件人的限制;連結也不應因為預期不被搜尋引擎索引,就被視為私密。共享連結 FAQ提供的是具體產品行為,其他工具則應查各自的保存與分享政策。

一個可落地的最小迴路

對工程團隊來說,最小流程可以是:

  1. 先定義人類 owner。 他要為哪個判斷與哪份證據負責,而非只負責按下送出。
  2. 要求 AI 顯示可驗證的依據。 例如來源連結、測試結果、假設與未解風險;沒有證據就不升級成結論。
  3. 只在學習型任務加入延遲答案。 先讓人提出解法,再要求 AI 比較、提示或反駁。一次性文案整理不必假裝成訓練。
  4. 把敏感資料排除在預設輸入外。 能用摘要、匿名化資料或最小樣本完成的任務,就不要先貼整份原文。

這比「所有輸出都要人工逐字核可」更可執行,也比「模型看起來很可靠」更能長期維持品質。本站先前整理的證據式驗收與風險分流可作為工程任務的下一層實作:低風險工作走自動檢查,高影響工作保留人類決策與回寫機制。

AI 的速度是第一階收益;使用者的能力、判斷習慣與資料軌跡才是第二階結果。每次接受答案前多問一句「然後呢?」,不是降低生產力,而是決定這份速度究竟會累積成能力,還是累積成看不見的依賴。