top of page

非結構化數據

Updated: Apr 28

當提及大數據時,我們免不了聽到結構化、半結構化和非結構化數據這類術語。然而,結構化數據佔所有數據的比例不到兩成,而非結構化和半結構化數據是增長最快速的數據類別,在物聯網來臨之際,企業能夠管理和分析這類數據的能力變得愈來愈重要。這些從前被忽略的零散訊息,如今卻成為了人類探索「真相」的必經之路。所以很多企業趨之若鶩的數字化轉型過程中,千萬不能忽略數據的性質也在演變,下面簡單介紹一下它們的差別:

結構化數據:結構化數據是最容易搜索和組織的數據,因為它通常包含在行和列中,其元素可以影射到固定的預定義字段。例如Excel表格中存儲的數據就是典型的結構化數據。在結構化數據中,實體可以組合在一起以形成關係(比如「客戶」對「購買產品」)。這使得結構化數據易於存儲、分析和搜索,可以遵循數據庫設計出數據模型,比如按區域、產品或客戶提供銷售紀錄。

非結構化數據:非結構化數據不會包含在行列數據庫中,且沒有明顯關聯的數據模型,例如行車的軌跡路徑及速度。缺乏結構使得這些數據更難搜索、管理和分析,這就是為什麼企業容易丟棄非結構化數據的原因。直到機器學習的進步,令搜索、管理和分析這些數據變得更加容易,我們關注的非結構化數據開始包括了照片、視頻和音頻文件、文本文件、社交媒體內容、衞星圖像、演示文稿等。

半結構化數據:除了結構化和非結構化數據,還有第三類數據,總的來說就是兩者的混合。半結構化數據具有一些經定義或一致的特徵,但不符合關係數據庫預期那樣的結構。這類數據可以用特定的屬性(如語義標記或元數據)組織歸類,但數據保留了一定的靈活性。電子郵件就是一個很好的例子,雖然實際內容是非結構化的,但它確實包含結構化數據,如發件人和收件人的姓名和電子郵件地址、發送的時間等。另一個例子是數碼照片,圖像本身是非結構化的,但如果照片是透過智能手機拍攝,它將是日期和時間標記、地理標記,並且具有設備ID。照片可以被打上標籤,構成一個結構,如「狗」或「寵物」。很多被歸類為非結構化的數據,其實都屬半結構化,因為它包含一些分類特徵。

當前我們對數據更廣泛的定義,很大程度上讓企業對數據的營運模式帶來衝擊。為了彌補這些能力的缺失,企業有必要重新審視在數據生命周期中與競爭對手的差距。企業應該要明白到全新的數據營運模式,是更具外部性的競爭,更需要技術的支援。

Recent Posts

See All
選擇胖模型還是胖鞍具?

打開任何人工智能(AI)方案,你會看到兩種完全不同的產品策略在較量:一種叫做胖模型(Fat Model),另一種叫做胖鞍具(Fat Harness)。 胖模型的信念很直白:以更大的大腦解決更多的問題。參數多、數據龐大、算力強,模型自然顯得聰明。這驅動了ChatGPT、Claude和Grok之間的競賽──每一代都宣稱新產品比上一代更強,而企業只要付費就能直接使用,代價是你的AI能力完全綁定在供應商的

 
 
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
bottom of page