AI 產業報:Gemini 3.0 Pro 預覽版 | 視覺生成、3D 與自動化工具 | InfinityStar 登場

Photo of author

By 吹著魔笛的浮士德

發布

更新

生成式 AI 領域再次迎來了技術大爆炸的一週。從 Google 悄然釋出的 Gemini 3.0 Pro 預覽版,到字節跳動(Bytedance)推出的整合式圖像影片生成模型 InfinityStar,再到一系列專精於圖像修復、3D 建模與工作流程自動化的開源工具,整個產業正以驚人的速度向更高效、更精準、更易用的方向邁進。本週的發展不僅預示著大型模型的持續迭代,展現了 AI 技術在垂直應用領域的深度滲透。

生成式 AI 領域在過去一週內湧現出大量創新模型與應用工具,涵蓋大型語言模型、視覺生成、3D 渲染、協作平台及自動化工作流程等多個層面。

大型語言模型與協作工具新進展

Gemini 3.0 Pro 預覽版限定區域解禁

Google 旗下最新的大型語言模型 Gemini 3.0 Pro 已向部分開發者開放。目前僅有特定地區與帳號能透過 Google Vertex AI 平台,存取名為 gemini-3-pro-preview-11-2025 的預覽版本。雖然有中國地區的服務可以試用,但建議還是等正式開放就好。

Microsoft 推出 Copilot Groups 功能

Microsoft 為其 AI 助理 Copilot 推出了名為 Copilot Groups 的群組聊天功能,最多支援 32 人共同協作。使用者可以邀請朋友或同事進行專案規劃,該功能整合了議題摘要、選項建議、投票統計與任務分配等能力,旨在提升團隊協作效率。

Google Workspace Flows 實現無程式碼自動化

Google 推出了 Google Workspace Flows,這是一個搭載 Gemini AI 的無程式碼解決方案。使用者僅需透過自然語言下達指令,即可創建自訂的 AI 代理人(Agent),自動化處理 Gmail、Google Drive 等應用程式之間的重複性工作。

Kimi K2 Thinking 專為複雜問題而生

由 Moonshot AI 推出的 Kimi K2 Thinking 模型,被設計用來解決複雜問題。其特色在於能透過逐步推理的方式調用工具,並能處理更長、更複雜的問題鏈,展現了強大的邏輯思考與工具整合能力。

視覺生成與編輯技術

本週視覺生成領域迎來多項重大突破,從品質提升到物理擬真,再到操控性的革新:

圖像品質提升與修復工具:Qwen Upscale & Light restoration

基於 Qwen 模型微調的兩款 LoRA 模型成為焦點。Qwen Upscale 專注於圖像品質恢復與最高 16 倍的超高解析度放大,有望衝擊現有付費服務。而 Light restoration 則能精準移除或修復圖像中特定的光影效果,例如消除過強光線並以柔光重新照明。

統一時空模型:InfinityStar

由字節跳動(Bytedance)發表的 InfinityStar 是一個創新的統一模型,能在單一架構內同時處理圖像與影片生成任務,包括文字生成圖像(T2I)、文字生成影片(T2V)等。它結合了自回歸模型的高效率與擴散模型的高品質,旨在實現高速、高解析度的視覺內容生成。

物理擬真的光影 AI:UniLumos

阿里巴巴達摩院的研究成果 UniLumos 旨在解決生成模型中常見的光影不協調問題。它將物理法則的幾何學回饋融入模型,使其能生成符合現實世界光影邏輯的圖像與影片。

單張圖片生成 3D 頭像:PercHead

PercHead 框架僅需一張臉部照片,即可重建出高品質、多視角一致的 3D 頭部模型,並允許使用者透過文字或手繪圖等方式,直觀地編輯模型的樣貌與風格。

高階影片與音訊生成:CamCloneMaster & UniAVGen

CamCloneMaster 讓使用者能透過提供一段參考影片,自動提取其運鏡軌跡並應用到新影片中,大幅簡化了鏡頭設計。UniAVGen 則是一個統一的音訊與影片生成模型,旨在解決嘴形不同步、情感不一致等問題,實現音畫高度協同。

3D 渲染與開發工作流程

百秒完成訓練:FastGS

FastGS 是一個通用框架,它透過優化策略,成功將 3D 高斯潑濺(3D Gaussian Splatting)的訓練時間縮短至 100 秒以內,同時保持了與頂尖技術相媲美的渲染品質,極大提升了 3D 場景的建構效率。

創作者的得力助手:Krea Nodes & ResolutionMaster

Krea Nodes 是 KREA AI 推出的新功能,它將平台內所有 AI 工具整合為節點式介面,讓創作者能打造自動化的複雜創意工作流程。而 ResolutionMaster 是一款為 ComfyUI 設計的自訂節點,提供視覺化介面,讓使用者能精確控制圖像的解析度與長寬比。

機器人與電腦視覺

通用人形機器人:AgiBot A2

身高 169 公分、體重 69 公斤的 AgiBot A2 是一款搭載先進 AI 的通用人形機器人,旨在提供商業與娛樂領域的互動服務,展現了 AI 技術走向實體化的趨勢。

物體偵測模型:YOLOv12

作為廣受歡迎的 YOLO 系列最新版本,YOLOv12 進一步提升了即時物體偵測的速度與準確性,即使是部分被遮擋的對象也能進行精確的偵測與計數。

參考資料:https://note.com/toshia_fuji/n/n28dd784d43f3

合作廣告
Photo of author

吹著魔笛的浮士德

出生在港都的南部囡仔,十歲前後在堂哥家裡看見《三國志 III》的遊戲畫面以後,感覺看見了一道通往全新人生的大門,回家拜託父親組一台 486 電腦給自己,從此與電玩結下不解之緣。

合作與新聞投稿:[email protected]

追蹤社群平台:
Instagram | Facebook 專頁 | Threads | Twitter

本站評測與報導可能包含聯盟行銷連結,這將幫助我們維持營運。