【AI 產業週報】Zoom AI 異軍突起,在基準測試中擊敗 GPT-5 Pro;快手 Kling 2.6 實現影音同步生成

Photo of author

By 吹著魔笛的浮士德

發布

更新

本週的生成式 AI 領域迎來多項重大技術突破與應用更新,其中最令人意外的莫過於通訊軟體巨頭 Zoom 的 AI 模型在困難的基準測試中超越業界領先者。同時,中國快手科技的影片生成模型 Kling 2.6 實現了影音同步生成的里程碑,而 Google 則持續將其 Gemini 模型深度整合至旗下產品線,從虛擬試衣到即時翻譯,全面加速 AI 技術的商業化落地。

本週最令人矚目的消息之一,是通訊軟體公司 Zoom 在 AI 領域的驚人表現。其「Federated AI」模型在一項名為「人類最後的考試」(Humanity’s Last Exam,HLE)的 AI 高難度基準測試中,以 48.1% 的準確率拔得頭籌,表現超越了備受期待的 Gemini 3 Pro 與 GPT-5 Pro 模型,成為意想不到的黑馬,也讓外界開始重新評估其在 AI 領域的技術實力。

與此同時,Google 持續強化其 AI 生態系。最新進展是將 Gemini AI 與其筆記工具 NotebookLM 進行整合,使用者未來將能直接在 Gemini 的介面中附加 NotebookLM 的上下文資料,利用其強大的分析能力處理大量文件、會議記錄或程式碼,並從中提取洞見。此功能目前正逐步向使用者推送。

在消費者應用方面,Google 推出了全新的 AI 虛擬試衣工具。該工具利用 Google 龐大的購物資料庫 Shopping Graph,為使用者提供高度個人化的試衣體驗,並支援不同體型的模特兒與全身照片,大幅提升電子商務的購物便利性。此技術以 Nano Banana 模型為基礎,目前僅在美國地區提供。此外,Gemini 的即時語音翻譯功能也已作為 Beta 版本在 Google Translate 應用程式中推出,能更精準地捕捉人類說話的語氣與細微差異,實現更自然的跨語言溝通。

影音生成:Kling 2.6 引領影音同步

由中國快手科技開發的 AI 影片生成工具「Kling AI」,其最新模型「Kling 2.6」正式亮相。此版本最大的突破在於其「原生音訊生成」(native audio generation)功能,能在透過文字或圖片生成影片的同時,自動產出對白、音效、環境音與背景音樂,並確保影音完美同步,解決了過往版本需要後製配音的痛點,大幅簡化了創作流程。

影像處理與 3D 內容生成工具百花齊放

除了主流平台的更新,本週亦有多款針對特定需求的 AI 工具與框架發布:

  • GenLit: 一種創新的單一圖像再打光(relighting)框架,能將靜態圖片轉換為動態影片,透過控制虛擬點光源的位置來改變場景中的光影效果。
  • SHARP: 由 Apple 研究人員開發,此技術能從單張 2D 圖片中即時合成逼真的新視角,在不到一秒的時間內完成場景的 3D 渲染。
  • ComfyUI-ProportionChanger: 針對 AI 繪圖工具 ComfyUI 開發的客製化節點,允許使用者直接操作關鍵點數據來調整人物的體型比例與姿勢,克服了傳統姿勢估算模型難以處理特殊體型的限制。
  • Omni-Attribute: 一款視覺概念個人化模型,能精準學習參考圖片中的特定屬性,例如服裝圖案、表情或髮型,並將其應用於新的圖像生成中。
  • ProtonGraph: 一款基於節點的程序化 3D 內容生成軟體,使用者可以透過連接簡單的節點來創建複雜的 3D 模型,類似於 3D 領域的視覺化腳本工具。
  • MoCapAnything: 一個統一的 3D 動態捕捉框架,可從單一鏡頭的影片中為任何骨架結構的物體進行高精度動態捕捉,突破了傳統動態捕捉技術對特定物種或模板的依賴。

創作者與開發者輔助工具

為提升 AI 內容創作的效率,社群也推出了多款實用工具:

  • PromptCraft: 一個視覺化的提示詞(prompt)管理系統,幫助使用者在使用 Midjourney、DALL-E 等平台時,能更直觀地整理、參考並管理帶有視覺參照的提示詞。
  • Nano Banana Elements: 這是 KREA AI 的一項新功能,允許使用者上傳少量圖片來創建自定義的風格、物件或角色元素集,並可在提示詞中直接調用,實現更具體的創意生成。

機器人與底層模型研究新進展

在更前瞻的研究領域,微軟發布了專為機器人操作設計的「VITRA-VLA」模型,該模型能從非結構化的人類活動影片中學習,讓機器人模仿人類手部動作以執行複雜任務。另外,阿里巴巴 PAI 團隊也推出了「Z-Image-Turbo-Fun-Controlnet-Union-2.0」,這是一款支援多重控制條件的高性能 ControlNet 模型,但目前傳出因模型過於龐大而難以在 ComfyUI 上運行的問題。

從本週發布的眾多 AI 工具與研究中可以看出,產業發展正朝向幾個關鍵方向邁進:首先,多模態能力的整合日益深化,如 Kling 2.6 的影音同步生成,預示著內容創作將更加無縫高效;其次,AI 的應用場景持續擴展至各個垂直領域,從電子商務的虛擬試衣到機器人操作,技術落地速度加快。

最後,開源社群的活力依然是推動創新的重要力量,各種客製化節點與框架的出現,為開發者與創作者提供了更靈活的工具。隨著競爭者不斷湧現,AI 技術的迭代速度預計將持續攀升。

資料來源: fujito (2025年12月15日). 【生成AIニュース+】『Kling 2.6』『Gemini+NotebookLM』他. note.

合作廣告
Photo of author

吹著魔笛的浮士德

出生在港都的南部囡仔,十歲前後在堂哥家裡看見《三國志 III》的遊戲畫面以後,感覺看見了一道通往全新人生的大門,回家拜託父親組一台 486 電腦給自己,從此與電玩結下不解之緣。

合作與新聞投稿:[email protected]

追蹤社群平台:
Instagram | Facebook 專頁 | Threads | Twitter

本站評測與報導可能包含聯盟行銷連結,這將幫助我們維持營運。