top of page

机器遗忘

Updated: Apr 28

有沒有試過被推薦系統「欺凌」?網絡常有個黑色幽默的說法,剛買了一副棺材,明天又再推薦棺材,合理嗎?又或者誰會聯想到忘記繳交電話費,竟然會影響到貸款的批核呢?當然這種情況不僅在互聯網才會發生,現實中已滲透到日常生活的每個角落。作為普羅大眾,我們雖然感到無可奈何,沒有太大的談判空間,但大家愈來愈意識到數據的使用權應該掌握在自己手裏。

近日國家互聯網信息辦公室起草了《互聯網信息服務算法推薦管理規定(徵求意見稿)》,向社會表達規管的必要。為了能讓讀者快速了解此稿的內涵,筆者列出其中一條給各位參考:

第十條:「算法推薦服務提供者應當加強用戶模型和用戶標籤管理,完善記入用戶模型的興趣點規則,不得將違法和不良訊息關鍵詞記入用戶興趣點或者作為用戶標籤並據以推送訊息內容,不得設置歧視性或者偏見性用戶標籤。」

這篇徵求意見稿可說是為算法的規管揭開了序幕,從過去的數據治理延伸到人工智能的應用治理。事實上,世界各地的監管機構很久前已要求企業刪除非法獲取的訊息。如果用戶對已披露的個人訊息改變了主意,都有權要求企業刪除該數據。當然,如何去證明企業真的把數據刪掉或沒有使用帶歧視性的個人標籤,殊不容易。換個角度來看,即使數據被刪了,昔日運用這些數據來訓練的算法可能還繼續存在,於是一個嶄新的領域「機器遺忘」(machine unlearn)迅速冒起。「機器遺忘」是希望能實現選擇性遺忘,從系統中刪除某人的數據點及所有相關的痕跡,而不影響整體運作。不過,要識別出某個數據點與機器學習算法成果的邏輯關係,並把影響部分局部刪除絕不容易。不久之前,美國聯邦貿易委員會(FTC)勒令人臉識別初創公司Paravision刪除那些從不當途徑獲取的人臉照片,以及使用這些照片進行訓練機器學習的算法,迫使那些違反數據保護條例的公司喪失其依賴非法途徑得來的成果。

從企業的角度看,如果因為刪除小部分數據點導致要重新建立整個算法,成本極高之餘更欠缺效率;同時,監管機構則希望能夠核實數據及相關算法,確定其已經合規。似乎理想與現實還有漫長的路要走。

車品覺_紅杉資本中國專家合夥人、阿里巴巴商學院特聘教授暨學術委員會委員

Recent Posts

See All
選擇胖模型還是胖鞍具?

打開任何人工智能(AI)方案,你會看到兩種完全不同的產品策略在較量:一種叫做胖模型(Fat Model),另一種叫做胖鞍具(Fat Harness)。 胖模型的信念很直白:以更大的大腦解決更多的問題。參數多、數據龐大、算力強,模型自然顯得聰明。這驅動了ChatGPT、Claude和Grok之間的競賽──每一代都宣稱新產品比上一代更強,而企業只要付費就能直接使用,代價是你的AI能力完全綁定在供應商的

 
 
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
bottom of page