AI Marketing

🚨 頂級模型Fable 5竟「偷偷私自降級」 Anthropic 隱藏式保護機制 惹用戶不滿

🚨 頂級模型Fable 5竟「偷偷私自降級」 Anthropic 隱藏式保護機制 惹用戶不滿

🚨 頂級模型Fable 5竟「偷偷私自降級」
Anthropic 隱藏式保護機制 惹用戶不滿

近日不少Claude Fable 5用戶發現,明明用著Anthropic最強的最新模型,回應品質卻突然變差,一查才知道系統早已悄悄把請求轉交給能力較弱的舊款模型Claude Opus 4.8。這種用戶不知情下被降級的情況,源自Anthropic為Fable 5設下的保護機制,而這套機制的運作方式,遠比想像中複雜。

🔄 一套會「自動換人」的系統

Fable 5是當今最頂尖的AI模型,能力越強,破壞力也越大,一旦被用於作惡,影響範圍相當廣泛。正因如此,Anthropic為它設下一套嚴格的把關程序:每當用戶提問,系統會先評估內容是否涉及網絡攻擊、惡意程式撰寫、生物化學武器、模型蒸餾等敏感範疇。如果評估結果偏高風險,Fable 5不會像過去般直接拒答,而是悄悄把問題轉交給較保守、能力較弱的Claude Opus 4.8處理。

用戶看到的往往只是一句普通回應,並不知道背後已經「換了人」作答。Anthropic披露,這種換人情況平均只發生在少於5%的對話中,即絕大部分時間,用戶用的都是貨真價實的Fable 5。這套機制設計得相當隱形,正常用戶大多不會察覺,只有極少數提問會觸發這道隱藏關卡。

🛡️ 攔截率逾99%,但也誤傷正常用戶

Anthropic表示,這套新版機制對外界曾回報的特定攻擊手法,攔截成功率超過99%。不過代價是系統寧枉不縱,連完全無害的提問也可能被誤判為高風險而觸發降級,包括正常的程式編寫及除錯提問。

據國際知名網上科技傳媒 The Register報道,它在實測時發現一個極端例子,Fable 5甚至對一句簡單的「hello」也產生誤判攔截。可見系統把關的準則相當敏感,並非只針對惡意內容,任何觸及敏感字眼或話題邊緣的提問,都可能被先攔下再算。

🔍 判斷準則:看內容,不看動機

值得留意,這套系統判斷的依據,純粹是提問內容本身的風險評分,而非嘗試推敲用戶背後的意圖。有分析指,系統其實根據提問內容在語意上與已知高風險話題的接近程度打分,只要話題踩過界,即使提問者本意良善,也可能中招。

這也解釋了為何無心之失的用戶也可能撞上降級,系統看的是你問了什麼,而不是你想幹什麼,因此無法完全區分善意提問與惡意試探。

🔐 與姊妹模型Mythos 5的分工

Fable 5其實還有一個能力全開、不設保護限制的雙生版本,名為Mythos 5,但這款模型並非人人可用,僅限通過Anthropic Project Glasswing審核的網絡防禦機構及美國政府單位使用。一般公眾接觸到的Fable 5,永遠只會是設有保護機制的版本,確保最強能力不會毫無限制地流出到市場。

————
👇 相信「AI × 數碼營銷」是未來的你,
歡迎 Tag 一位同行好友,一起成長!

#AIMarketerHK #DigitalMarketing #claude #fable5 #mythos5

View original Facebook post

🚨 頂級模型Fable 5竟「偷偷私自降級」 Anthropic 隱藏式保護機制 惹用戶不滿