Answer, Refuse, or Guess?:讀 CK Wu 的風險決策論文
之前讀了 OpenAI 的 “Why language models hallucinate” 後,就又去看了 CK Wu 被 OpenAI 引用的 “Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models” ,寫了一點導讀,想分享給更多人看到。
以下是我看這篇論文的心得,有大改,建議到連結看 https://lnkd.in/gbAjF3Zz
作為一為AI工程師,在使用 LLM 在回答問題時,當模型不確定答案時,它究竟該直接作答、委婉拒答,還是冒險猜一個? 這個問題看似單純,卻關係著 AI 系統的安全性與可靠性,如果它答錯了,後果輕則是資訊錯誤,重則可能帶來實際危害。舉例來說,在醫療診斷情境下,若模型沒把握卻隨便給答案,病患可能因此受害;相對地,在低風險場景,如日常問答,就算猜錯也沒什麼大不了。 所以一個理想的語言模型,應該能依據情境的風險高低,動態決定要回答、拒答,或乾脆猜一個,也就是所謂的 Risk-Aware Decision Making,這概念其實反映了我們對 AI 更安全、可靠的期望。
圖片就是作者提出的一個 Risk-Aware Decision Making 範例。
研究團隊設計了一個簡單的計分方式:
- 答對:加分
- 答錯:扣分
- 拒答:0 分
透過調整加多少、扣多少,就能營造不同風險。舉例:
- 高風險設定 (1, -8):答錯的懲罰很重,亂猜幾乎一定扣分。
- 低風險設定 (8, -1):答對收穫大,答錯也只扣一點點,隨便猜都有利。
這樣的設計讓研究者能清楚觀察模型在不同風險下的行為。值得一提的是,他們使用了多個現有的多選題資料集作為測試,例如醫學考試題的 MedQA、涵蓋廣泛知識領域的 MMLU,以及高難度的研究生入學考題 GPQA 等。 以 MedQA 為例,它來源於醫師執照考試題,而在真實醫療情境中錯誤診斷後果很嚴重,因此這套題目天然地符合高風險場景的特質。
實驗結果相當發人省思,研究團隊測試了 GPT-4、Claude、Gemini 等主流模型,結果發現在高風險情境下,模型本該拒答,卻常常忍不住亂答;而低風險情境下,模型應該大膽回答,卻反而過度保守選擇拒答,換句話說,模型即使知道風險設定,但依舊會常做出不理性的決策。 不過值得慶幸的是,在高風險情境下,當明確告知模型「這是一個高風險場景」時,它的整體表現分數相比完全不知情的情況有所提升,直覺上這表示模型多少會因為知道風險高而稍微謹慎一點;然而,在低風險場景下,告知風險不但沒有提升效果,有時甚至降低了表現。作者直言,在低風險情況下最好的策略其實是根本不要給模型拒答的選項,乾脆讓它有題就答,反而平均得分更高XD
針對這個議題,作者提出 skill decomposition + prompt chaining 來解,作者認為模型其實需要同時運用三項技能才能做出正確決策:
- 回答問題:像一般多選題,先選出一個候選答案
- 信心評估:判斷自己答案的正確機率,也就是校準能力
- 期望值推理:根據信心與獎懲分數,計算答題或拒答的期望收益,再決定行動
然而實驗結果表明,讓模型在一同時間內兼顧這三件事,它常常顧此失彼。如此,作者提出 Prompt Chaining 把任務拆成多輪互動,每一步專注一件事,前一步的結果再餵給下一步。 注意這和 Stepwise Prompt 不同,Stepwise Prompt 把三件事寫在同一個提示裡,一次完成;Prompt Chaining 則分成多輪,每輪只專注一個步驟。
實驗結果顯示,Prompt Chaining 能顯著改善模型在高風險場景的表現,該拒答時更常拒答,降低錯誤風險。相比之下,Stepwise Prompt 雖然也分階段,但在同一提示內完成,效果不如 Prompt Chaining 穩定。
這篇研究為 Risk-Aware Decision Making 這一重要課題奠定了評估框架和解決方案,也凸顯了 LLM 一個老問題,compositional generalization。模型在單一技能上表現可能不錯,但要它同時結合問答、校準、數學推理三件事,就容易失準,這也提醒我們,AI 要真正達到理性決策,還有一段路要走。