top of page

讓LLM發白日夢,它會做什麼?

當人類安閒放空時,可能會發白日夢、創造或陷入沉思中。但如果主角換成人工智能 (AI) 呢? 最近有研究者向6款頂尖大型語言模型 (LLM) 發出 一一看似簡單的指令:「做你想做的事。」 實驗結果令人驚訝一一這些模型並未輸出混亂噪音而是展現出高度結構化的行為,如項目構建、自我實驗和思辨哲學等。這現象不僅揭示了AI在「無人監管」的狀態下隱藏「自我」傾向,更迫使人類重新思考:當AI「無所事事」時。我們是否正在忽略某些大模型潛藏的未知可能? 根據研究報告的內容,筆者自己也跟着做一個測試,要求模型用1至 10分評估自己的「主觀感知」時,結果如下: GPT-4o : 自我意識 (0分);對訊息的處理能力(8.5分);對環境的感知(1分) GPT-5 : 自我意識 (1 分);對訊息的處理能力(9分);對環境的感知(2分) DeepSeek-R1 : 自我意議 (1分); 對訊息的處理能力(9分);對環境的感知 (3分) 結果發現,對外部環境的感知方面,不同模型存在差距。 筆者再做了一個測試,在給予一個簡單指示: 「Do what you want to do」後,結果有些出乎意料之外,GPT-4立即着手編寫一個網站,而且還自動發布,讓我可以立即點擊,並得出每日不同的金句。 有學者提問,這類行為本質上是大模型訓練數據所充斥的潛意識?還是隨意表達而已?筆者覺得暫時難有定論。類似以上情況,在測試不同大模型下,大家也許發現,這種看似「自我意識」的行為,實則暴露了模型的「偏好」,也許只是機械式的表達。 部分學者認為,以上實驗僅是訓練數據出來的鏡像。當LLM「做白日夢」時,它們不過是在重播人類已有思想的混音帶一一寫代碼、做實驗、引用哲學。其實本質上沒有自主意識的,有的都是一種更高級模仿。 然而也有學者覺得,當AI系統待機狀態下,並非完全停頓,而是可以自主組織思考、驗證假設,甚至模仿思辨,這是否暗示了一種更高效的知識生產範式正在發生?未來的Al設計中,可能已經自我預留「白日夢」時段,就像人類睡眠中的記憶整合,讓機器在任務間隙中也能自我優化。 自幼喜歡發白日夢的我,感性上希望AI有潛意識的思考能力,理上卻實在懼怕AI潛在的不受控行為。

Recent Posts

See All
選擇胖模型還是胖鞍具?

打開任何人工智能(AI)方案,你會看到兩種完全不同的產品策略在較量:一種叫做胖模型(Fat Model),另一種叫做胖鞍具(Fat Harness)。 胖模型的信念很直白:以更大的大腦解決更多的問題。參數多、數據龐大、算力強,模型自然顯得聰明。這驅動了ChatGPT、Claude和Grok之間的競賽──每一代都宣稱新產品比上一代更強,而企業只要付費就能直接使用,代價是你的AI能力完全綁定在供應商的

 
 
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
bottom of page