
生成式 AI 領域再次迎來了技術大爆炸的一週。從 Google 悄然釋出的 Gemini 3.0 Pro 預覽版,到字節跳動(Bytedance)推出的整合式圖像影片生成模型 InfinityStar,再到一系列專精於圖像修復、3D 建模與工作流程自動化的開源工具,整個產業正以驚人的速度向更高效、更精準、更易用的方向邁進。本週的發展不僅預示著大型模型的持續迭代,展現了 AI 技術在垂直應用領域的深度滲透。
生成式 AI 領域在過去一週內湧現出大量創新模型與應用工具,涵蓋大型語言模型、視覺生成、3D 渲染、協作平台及自動化工作流程等多個層面。
大型語言模型與協作工具新進展
Gemini 3.0 Pro 預覽版限定區域解禁
Google 旗下最新的大型語言模型 Gemini 3.0 Pro 已向部分開發者開放。目前僅有特定地區與帳號能透過 Google Vertex AI 平台,存取名為 gemini-3-pro-preview-11-2025 的預覽版本。雖然有中國地區的服務可以試用,但建議還是等正式開放就好。
Microsoft 推出 Copilot Groups 功能
Microsoft 為其 AI 助理 Copilot 推出了名為 Copilot Groups 的群組聊天功能,最多支援 32 人共同協作。使用者可以邀請朋友或同事進行專案規劃,該功能整合了議題摘要、選項建議、投票統計與任務分配等能力,旨在提升團隊協作效率。
Google Workspace Flows 實現無程式碼自動化
Google 推出了 Google Workspace Flows,這是一個搭載 Gemini AI 的無程式碼解決方案。使用者僅需透過自然語言下達指令,即可創建自訂的 AI 代理人(Agent),自動化處理 Gmail、Google Drive 等應用程式之間的重複性工作。

Kimi K2 Thinking 專為複雜問題而生
由 Moonshot AI 推出的 Kimi K2 Thinking 模型,被設計用來解決複雜問題。其特色在於能透過逐步推理的方式調用工具,並能處理更長、更複雜的問題鏈,展現了強大的邏輯思考與工具整合能力。
視覺生成與編輯技術
本週視覺生成領域迎來多項重大突破,從品質提升到物理擬真,再到操控性的革新:
圖像品質提升與修復工具:Qwen Upscale & Light restoration
基於 Qwen 模型微調的兩款 LoRA 模型成為焦點。Qwen Upscale 專注於圖像品質恢復與最高 16 倍的超高解析度放大,有望衝擊現有付費服務。而 Light restoration 則能精準移除或修復圖像中特定的光影效果,例如消除過強光線並以柔光重新照明。
- https://huggingface.co/vafipas663/Qwen-Edit-2509-Upscale-LoRA
- https://huggingface.co/dx8152/Qwen-Image-Edit-2509-Light_restoration
統一時空模型:InfinityStar
由字節跳動(Bytedance)發表的 InfinityStar 是一個創新的統一模型,能在單一架構內同時處理圖像與影片生成任務,包括文字生成圖像(T2I)、文字生成影片(T2V)等。它結合了自回歸模型的高效率與擴散模型的高品質,旨在實現高速、高解析度的視覺內容生成。

物理擬真的光影 AI:UniLumos
阿里巴巴達摩院的研究成果 UniLumos 旨在解決生成模型中常見的光影不協調問題。它將物理法則的幾何學回饋融入模型,使其能生成符合現實世界光影邏輯的圖像與影片。

單張圖片生成 3D 頭像:PercHead
PercHead 框架僅需一張臉部照片,即可重建出高品質、多視角一致的 3D 頭部模型,並允許使用者透過文字或手繪圖等方式,直觀地編輯模型的樣貌與風格。

高階影片與音訊生成:CamCloneMaster & UniAVGen
CamCloneMaster 讓使用者能透過提供一段參考影片,自動提取其運鏡軌跡並應用到新影片中,大幅簡化了鏡頭設計。UniAVGen 則是一個統一的音訊與影片生成模型,旨在解決嘴形不同步、情感不一致等問題,實現音畫高度協同。
3D 渲染與開發工作流程
百秒完成訓練:FastGS
FastGS 是一個通用框架,它透過優化策略,成功將 3D 高斯潑濺(3D Gaussian Splatting)的訓練時間縮短至 100 秒以內,同時保持了與頂尖技術相媲美的渲染品質,極大提升了 3D 場景的建構效率。
創作者的得力助手:Krea Nodes & ResolutionMaster
Krea Nodes 是 KREA AI 推出的新功能,它將平台內所有 AI 工具整合為節點式介面,讓創作者能打造自動化的複雜創意工作流程。而 ResolutionMaster 是一款為 ComfyUI 設計的自訂節點,提供視覺化介面,讓使用者能精確控制圖像的解析度與長寬比。

機器人與電腦視覺
通用人形機器人:AgiBot A2
身高 169 公分、體重 69 公斤的 AgiBot A2 是一款搭載先進 AI 的通用人形機器人,旨在提供商業與娛樂領域的互動服務,展現了 AI 技術走向實體化的趨勢。
物體偵測模型:YOLOv12
作為廣受歡迎的 YOLO 系列最新版本,YOLOv12 進一步提升了即時物體偵測的速度與準確性,即使是部分被遮擋的對象也能進行精確的偵測與計數。
參考資料:https://note.com/toshia_fuji/n/n28dd784d43f3