top of page

Sora降內容創作門檻

早前美企OpenAI發布首個文字生成視頻模型Sora,把文字生成技術應用於視覺媒體創作上。官網已上傳了示範影片,影片長達60秒。示例中,Sora不僅能準確呈現高度細緻的背景、複雜多角度鏡頭,還能理解物體在物理世界的存在,並生成具有豐富情感的角色。Sora似乎是一個創新的突破,此類模型對影視製作、遊戲開發、虛擬實境等領域來說,都是一個巨大飛躍。這樣的技術能大幅降低創建精細視覺內容的門檻,並可能開啟未來全新的創意表達方式。 其中一個情節中,模型能夠解讀文本中對場景的描述,當輸入提示「東京街頭」、「充滿溫暖霓虹燈光和動感城市標誌的街道」、「時髦的女士」、「黑色皮褸」和「紅色裙子」,Sora便能夠把這些描述轉化為視覺效果,創造出合適的角色及環境。在生成的影片中,主角(女士)行走的動作連貫和穩定,這需要高度的動作捕捉和渲染能力。 模型能夠提供從不同角度捕捉場景,包括全景和特寫等,這樣的切換可為視頻添加敍事深度。模型亦能反映細節,例如「潮濕的街道地面反射霓虹燈的光影效果」,顯示出模型在處理光線和材質方面的進階能力。這種技術能大幅度提升影視製作的效率,尤其是在預視(Previsualization)、概念藝術創作和動畫製作等方面。此外,還可以為廣告、遊戲場景設計和虛擬現實創造更加豐富和互動的體驗。 有專家發表對Sora的感想,他表示內容創作行業已徹底改變,並且毫不誇張地說入行20年了,這次真的讓他無言,動畫藝術家們有麻煩了。技術壁壘大大移除,反而內容背後的「構思」和故事,將變得更為重要。 Sora模型當前亦存在弱點,它可能難以準確地模擬和類比複雜場景的物理原理,例如物體如何在不同條件下相互作用、運動和反應。在影片內容製作中,這可能導致生成的敍事,在邏輯上不連貫或缺乏說服力。 舉例來說,假設要創作一個玻璃杯從桌子上滾落並破裂的場景,現時的模型生成一個看似合理的場景,但在處理杯子破裂時的碎片飛散、液體溢出和玻璃碎裂次序、聲音效果,以及與其他物體的互動等,可能會顯得不自然或不準確。當然,通過用戶反饋,相信很快會迭代改善,這亦是該類模型最巧妙之處。

Recent Posts

See All
慎防智能代理「無聲」脫軌

試想想,人工智能(AI)系統已在生產環境中完成部署,但究竟要如何防止AI「悄然失靈」?過去3個月,全球超大規模企業在AI基礎設施上的資本支出達到一個前所未有的量級。單憑這一數據,人們或許會得出結論:AI的生產化部署正在全力推進,市場充滿信心。 然而,7月份第一周,來自不同領域的幾個訊號同時浮現,揭示出一個更為複雜的真相。一邊是史無前例的基礎設施投資;另一邊是一群深諳「系統可靠性」的專家──那些專門

 
 
AI預算黑洞 根源在架構設計

過去兩年。美國眾企業不約而同墮入一個速成陷阱: 認為購買了一個模型、聘請幾位演算法工程師、便能成功實現人工智能 (AI) 落地。然而,即使模型選擇正確數據卻 難以整合;數據成功整合,系統卻無法運行;系統成功運行,但業務部門不會操作;即使學會操作,3個月後模型又變得過時。 問題根源其實不在模型,而在架構。猶如建造大樓,若設計圖存在缺陷,再昂貴的材料也難以支撐。許多企業投入巨資購買「鋼筋水泥」(模型和

 
 
智能代理編程戰 懂人機協作致勝

上周把兩個消息放在一起看,很有意思。 第一個,Anthropic宣布Claude Code推出Artifacts,讓軟件工程師在寫程式的過程中,業務主管能同時打開網頁儀表板,就能看到軟件即時更新及開發的狀態。 第二個,中國人民大學和微軟亞洲研究院聯合推出一個叫Arbor開源自主人工智能體的新框架,系統能自動提出假設、修改代碼,運行真實實驗並從結果中學習,自動優化解決問題。 過去一年大家比併的是模型

 
 
bottom of page