top of page

科學化測試助決策有局限

Updated: Apr 28

有一段長時間,美國的零售企業很盛行通過直郵廣告來招攬顧客,他們以不同小區(郵寄編號)作為顧客分群,用隨機方式進行內容測試和數據追蹤,找出潛在顧客的商品及價格偏好。銷售傳單(Promotional flyer)為實驗經濟學中早期採用的宣傳策略之一,在一次實驗中,零售公司為其商品在宣傳單張中的價格變化進行實驗,想知道改用9字結尾的價格(譬如19元、29元)會否帶來更高銷量。他們把傳單前端和末段的商品價格改成9字尾,其餘項目價格則保持不變;結果研究人員發現,9字結尾的價格更能提升銷量。

近10年來,科學化測試已成為科技行業管理決策的標準組成部分,科企不僅用該方法協助商業決策,它也變成重要的企業文化,特別是產品功能設計上,與其爭論不休,倒不如聽取客戶在實驗中的答案。然而採用此方法前,筆者想先列出一些常見問題:

局限一:測試者數量不足 如果實驗的樣本量太少,即使兩個隨機分配的組別之間存在巨大差異,得出的實驗結果仍可能與現實不符,這也可歸因於噪聲。例如︰從小量樣本的測試者中,看到拋硬幣連續拋出兩次正面,就得出言之鑿鑿的推論,斷定該枚銀幣有問題。

局限二:隨機化很難實現 若未能做到徹底的隨機化,就難以知道被測試的因素是否真正導致了實驗揭示的結果。相比真實環境,互聯網平台更容易操控客戶所看到的內容,譬如向某些用戶展示網頁的一種設計,另向其他用戶展示另一款設計,然後跟蹤不同設計之間的用戶行為差異。

局限三:需要大量數據來衡量實驗效果 數據缺乏一向是主要的實驗壁壘,由於評估實驗的效果須測量相關的數據結果──這可能既昂貴又複雜。數碼時代使跟蹤數據變得容易,至少有利於項目的成本及效益管理。

局限四:低估決策者的不可預測性 當人們認為決策者的行為非常穩定、可預測時,往往會低估實驗的複雜度。心理學的一大貢獻是使人們更深入地了解決策者思維的脆弱性、環境特異性和敏感性。

局限五:猜測效果的能力時過於自信 在做決定時,我們往往未能意識到自己的直覺是多麼的偏離軌道,而過度自信會導致管理者單憑直覺行事,而非通過實驗來確定最佳行動方案。對產品的快速反饋和大量數據,使我們認識到不能對非科學化的方案太有自信。

科學化測試為科技公司帶來了巨大回報,直接的實驗有助快速改進產品設計、減少資源浪費及更能追上潮流,這可能正好符合今天以網絡為中心的Z世代用戶群要求。

車品覺_紅杉資本中國專家合夥人、阿里巴巴商學院特聘教授暨學術委員會委員

Recent Posts

See All
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
智能代理編程戰 懂人機協作致勝

上周把兩個消息放在一起看,很有意思。 第一個,Anthropic宣布Claude Code推出Artifacts,讓軟件工程師在寫程式的過程中,業務主管能同時打開網頁儀表板,就能看到軟件即時更新及開發的狀態。 第二個,中國人民大學和微軟亞洲研究院聯合推出一個叫Arbor開源自主人工智能體的新框架,系統能自動提出假設、修改代碼,運行真實實驗並從結果中學習,自動優化解決問題。 過去一年大家比併的是模型

 
 
bottom of page