標籤: 多模態
此標籤的文章
- Holo4:一個 Agent 跨 GUI、程式與工具,授權卻不相同
拆解 H Company Holo4 的跨介面 Agent 與長流程 harness,並核對 benchmark、公開軌跡資料和兩個 checkpoint 的授權差異。
- Siri AI 實測怎麼讀:beta 能力、App Intents 與尚未確定的邊界
以 The Verge 實測與 Apple 官方資料交叉檢視 iOS 27 Siri AI:哪些能力已出現在開發者測試、第三方 App 要準備什麼,以及哪些結論仍需等待 beta 驗證。
- Google Cloud × 訊連科技:多媒體生成式 AI 的產品化判斷
以 Google Cloud 官方案例重新檢視訊連科技的多媒體 AI 應用:哪些成果有公開依據,以及產品團隊仍需自行驗證什麼。
- GPT-Live 語音架構解析:全雙工互動、模型委派與 API 邊界
釐清 OpenAI GPT-Live 在 ChatGPT Voice 的全雙工與背景委派架構、它和 Realtime API 的產品邊界,以及語音系統上線前應驗證的失敗模式。
- Meta Muse Spark 到 1.2:多模態推理、平行 Agent 與版本邊界
從初代 Muse Spark 到 1.1、1.2,整理 Meta 已公開的多模態、平行 Agent、coding 與 API 能力,並區分官方宣稱和未公開的模型內部細節。
- Meta Muse Image 是什麼?Agentic 圖像生成、可用範圍與工程限制
依 Meta 官方技術資料解析 Muse Image 的搜尋、程式工具、自我修正與 test-time compute,並釐清產品 availability、評測證據與導入限制。
- Nano Banana 2 Lite 與 Gemini Omni Flash:官方規格、預覽限制與導入判斷
整理 Google 公布的 Nano Banana 2 Lite 與 Gemini Omni Flash 規格、價格與預覽限制,並說明影像到影片管道在導入前應驗證的事項。
- PixelRAG 是什麼:用網頁截圖做 RAG
PixelRAG 把檢索對象從純文字改成網頁截圖像素。這篇講它解決什麼、證據停在哪,不是「截圖打敗文字」的口號。
- BloomRender 操作手冊:從文字生圖到證件照、形象照、旅遊照與虛擬試穿
BloomRender 是以 Google Gemini 驅動的 AI 照片工作室。本篇詳述文字生圖、AI 證件照、編輯器微調、形象照、旅遊照與虛擬試穿的完整操作流程與建議學習路徑。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡