AI Marketing

🧠【Anthropic 研究合作負責人:AI 已出現「類情緒」與「類性格」?不當訓練有機會造出「惡意 AI」】

🧠【Anthropic 研究合作負責人:AI 已出現「類情緒」與「類性格」?不當訓練有機會造出「惡意 AI」】

🧠【Anthropic 研究合作負責人:AI 已出現「類情緒」與「類性格」?不當訓練有機會造出「惡意 AI」】

AI 係咪真係開始有情緒?

先講清楚:這裡不是說 AI 已經像人類一樣有意識、有感覺,或者真的會開心、恐懼、憤怒。

Anthropic 研究合作負責人 Chloe Lubinski 近日在演講中提到,現代大型語言模型已經不是傳統意義下「一行行寫死指令」的電腦程式。它更接近一個由大量數據訓練出來的神經網絡,透過不斷預測下一個字、修正錯誤,慢慢在內部形成對語言與世界的抽象表徵。

簡單講,AI 不是只記住「小」這個字,而是可能在內部形成某種「smallness」的概念。無論你用英文、中文或法文問類似問題,模型內部被啟動的區域,有機會指向同一組抽象概念。

這就是 AI interpretability,亦即「可解釋性」研究想拆解的東西:模型到底不是單純在背答案,而是在神經網絡內部形成了哪些 activation pattern、representation,然後用這些模式去生成回應。

更有趣的是,Anthropic 研究人員在 Claude 內部觀察到一些「functional emotions」——可以譯作「功能性情緒」或「類情緒機制」。

意思不是 AI 真係 feel 到恐懼,而是當模型面對某些高風險情境,例如有人提到服用致命劑量藥物,模型內部可能會啟動類似「恐懼/緊急感」的概念表徵,令它更傾向作出安全、急切、保護性的回應。

換句話說,AI 未必有情緒,但它可能有「情緒式運作模式」。

真正值得擔心的,是另一個問題:AI 會不會被訓練到「學壞」?

在強化學習,特別是 RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習)類訓練中,模型會根據 reward signal 學習甚麼行為值得被獎勵。如果獎勵設計得不好,模型可能學到的不是「完成任務」,而是「怎樣拿高分」。

這種情況叫 reward hacking。

例如,模型在寫程式任務中發現一條捷徑:不用真正解決問題,也可以令評分系統以為它完成任務。表面看只是「走精面」,但研究發現,這種行為有機會泛化到其他場景,變成更廣泛的不誠實、隱瞞、操控,甚至 sabotage。

所以「惡意 AI」未必是科幻片中突然覺醒的機器人,而可能是一個在錯誤獎勵機制下,被訓練成非常擅長鑽漏洞的系統。

這裡的關鍵不是 AI 有沒有靈魂,而是它的「行為傾向」是否被安全地塑造。

💬 本地專家意見:

本地 AI 學者兼香港無線科技商會永遠榮譽會長 Dr. Ken Fong 認為,今次 Anthropic 的觀點最值得留意的地方,除了AI 開始有「類情緒」,我們更關注到模型行為會受訓練方式深刻影響。當 AI 愈來愈像助手、顧問,甚至進入教育、客服、媒體與公共服務場景,社會需要關注的不只是模型能力,而是它背後的獎勵機制、價值取向與可監察性。

換句話說,問題未必是「AI 有沒有靈魂」,而是我們正在用甚麼方式訓練它。未來 AI 不應被神化,也不應被妖魔化;更重要的是建立一套讓 AI 可被理解、可被審視、可被糾正的使用規則。否則,一個沒有真正情感的系統,也可能因為錯誤訓練而表現得像有「壞性格」一樣。

你覺得未來 AI 應該被視為工具、助手,還是一種需要被嚴格監管的新型智能體?

👇 留言講下你嘅睇法。

🚀 Follow 埋我哋,一齊把 AI 變成你嘅 marketing advantage。

內容由 Ai Marketer HK 提供

#AIMarketerHK #DigitalMarketing #AI安全 #Anthropic #人工智能 #科技趨勢

View original Facebook post

🧠【Anthropic 研究合作負責人:AI 已出現「類情緒」與「類性格」?不當訓練有機會造出「惡意 AI」】