top of page

圖像生成術慳水慳力

Updated: Apr 28

古語有云「見一葉落而知歲之將暮」,又說「山僧不解數甲子,一葉落知天下秋」,可見人類試圖通過觀察一個片面來達到舉一反三的效果古已有之,只是一些視角要待人造衞星、高解像攝錄器、無人機的發明後才可全面實現。從前跟隨長輩學習堪輿的時候,登山涉水方能理解山龍(脈)及水流結聚的走勢,真想不到現今能調節角度的鳥瞰圖居然唾手可得。 隨着人工智能的發展,研究人員正致力於解決一葉知秋的「逆向」問題:如果給出一幅地表的衞星圖像,那麼從地面上看這個地區將會呈現何種模樣?這樣的人工圖像能實現嗎?加州大學使用了嶄新的生成式對抗網路(GAN),即是兩周前我提及的兩個神經網路左右互搏(生成及判別)的演算法,通過分析衞星俯瞰圖像,A演算法可以生成地面仿真圖像,B演算法則利用地面真實圖像和該地區衞星圖像來訓練判別真偽的能力。

前提是數據集的品質非常重要,加州大學的研究人員選取了倫敦71x71公里、總共1.6萬組兩兩對應的俯瞰圖像和地面真實圖像來訓練演算法判別。下一步是把4000幅特定地點的衞星俯瞰圖像輸入生成器,利用判別的回饋與地面真實圖像相比作「左右互搏」。

判別土地用途準確率高

結果非常有意思,系統根據俯瞰圖像生成的圖像貼近現實,生成的圖像捕捉到地面基本特徵,比如是否有道路,是農村還是城市等等。惟不出所料,它們缺乏真實圖像的更多細節。這項技術很巧妙,但用處有多大?城市規劃中的一個重要任務,是根據用途對土地進行分類,比如是工業區、住宅區還是商貿區域。結果顯示在確定土地用途時,圖像生成技術的準確率為73%,而傳統方法的準確率只有65%。

生成式對抗網路提供了更省時省力收集土地用途的全新方法,我甚至認為,如果在前述的71X71公里範圍內能夠收集 足夠的移動手機數據,GAN有機會從俯瞰圖生成出關聯區域的人類經濟活動,這值得我們期待。

Recent Posts

See All
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
智能代理編程戰 懂人機協作致勝

上周把兩個消息放在一起看,很有意思。 第一個,Anthropic宣布Claude Code推出Artifacts,讓軟件工程師在寫程式的過程中,業務主管能同時打開網頁儀表板,就能看到軟件即時更新及開發的狀態。 第二個,中國人民大學和微軟亞洲研究院聯合推出一個叫Arbor開源自主人工智能體的新框架,系統能自動提出假設、修改代碼,運行真實實驗並從結果中學習,自動優化解決問題。 過去一年大家比併的是模型

 
 
bottom of page