top of page

暗數據潛藏風險

Updated: Apr 28

雖然如今表面上似乎有更多數據供應,但綜觀現時很多企業內部均無視數據缺失(Missing Data)問題,因而令數據分析能力受限制。這些數據缺失包括有意或無意丟失的情況,例如在最近一次街頭投票中,紙本選票與電子投票的結果迥異,某些人的紙本得票較電子點票高出很多,可能正好說明了「暗數據」(Dark Data)帶來的不公平性,例如部分群體對電子投票欠熟悉導致數據偏差。在企業中這種情況一點都不罕見,而且有時很容易被忽略,造成的影響可大可小,有時甚至涉及訊息倫理的道德問題,並成為一種冷暴力。

隨着數據量激增,廣泛存在着一種技術樂觀主義者的看法,即所謂大數據能治「百病」的傳說。大數據在某程度上是指一個龐大數據集,多樣且動態變化,用上文的例子解釋,遭邊緣化的群體因為對技術應用的流利程度,被隔絕在數據收集行為之外,結果使數據分析的結果僅通過有偏見的數據模式,來再度呈現當中的歧視和排斥。因此儘管近年數據量有所增加,但潛在的已知或未知數據缺失放在一起,依然限制了包容性決策的能力。有學者把這種現象稱為「暗數據」,藉此說明它可能潛在的風險,「暗數據」的缺失或包含非隨機和系統性的遺漏,導致數據把邊緣事件或者人群(無論這一邊緣人群是由於貧困、地理環境還是生活方式造成)排除在外,形成代表性不足。

為了讓大家進一步理解「暗數據」的形成及風險,下面列舉三種情況:

暗數據一:倘淘寶想觸及新的用戶群(如銀髮族),淘寶希望收集他們的購買偏向,但由於少數群體的數據量不足,以及在很多品類覆蓋率低,為彌補缺失,可以使用較接近的相似群組作為替代補充,當然這也意味着噪音的出現。換句話說,在大數據的環境中,缺失值的問題會隨着「替代品」增加而失真,分析的準確性亦愈發難以揣摩。

暗數據二:大數據的價值提升,大部分情況都是因為數據得到共享和整合所致。但面對不同來源的整合(我更喜歡叫作穿針引線Stitch),數據會由於不同格式及收集的場景性質而產生偏差。譬如客戶在購物網站所填寫的性別和其社交網絡資料可能不一樣,又或金融機構收集到的職業類別會較購物網站更準確。這意味着類型及量級不平衡的數據來源愈多,排斥的現象會愈嚴重。為解決此問題,機構需要了解數據中的質量差距,還有數據背後隱含的收集動機。

暗數據三:因基礎數據收集時間不一,可能導致對數據代表性不足的錯誤推斷。如果沒有明確的方法來調整歷史數據,而數據挖掘依賴於數據作為基礎事實,當這些輸入數據的新鮮度存在問題,例如沒有定期更新CRM(客戶關係管理)資料,系統將產生不可靠甚至是完全偏差的結果。

車品覺_紅杉資本中國專家合夥人、阿里巴巴商學院特聘教授暨學術委員會委員

Recent Posts

See All
選擇胖模型還是胖鞍具?

打開任何人工智能(AI)方案,你會看到兩種完全不同的產品策略在較量:一種叫做胖模型(Fat Model),另一種叫做胖鞍具(Fat Harness)。 胖模型的信念很直白:以更大的大腦解決更多的問題。參數多、數據龐大、算力強,模型自然顯得聰明。這驅動了ChatGPT、Claude和Grok之間的競賽──每一代都宣稱新產品比上一代更強,而企業只要付費就能直接使用,代價是你的AI能力完全綁定在供應商的

 
 
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
bottom of page