標籤: 多模態
此標籤的文章
- Siri AI 實測體驗:它對我們使用 iPhone 日常方式的影響與實務判斷
深度解析 The Verge 對 iOS 27 首個公測版 (Public Beta) 中 Siri AI 的一手評測。從全新的螢幕感知能力、行事曆智慧解析,到開發者必須實作的 Entities 與 Intents 架構,全面剖析 Apple 語音智能的未來。
- Google Cloud 與訊連科技:生成式 AI 對多媒體創作市場的影響與實務判斷
探討 Google Cloud 最新的多媒體 AI 技術(Imagen 3、Veo 等),以及訊連科技如何透過 Promeo 將這些強大的底層技術轉化為貼近使用者的 AI Agent,為創作者與中小企業帶來前所未有的商業競爭優勢。
- GPT-Live 語音架構解析:全雙工互動、模型委派與 API 邊界
釐清 OpenAI GPT-Live 在 ChatGPT Voice 的全雙工與背景委派架構、它和 Realtime API 的產品邊界,以及語音系統上線前應驗證的失敗模式。
- Meta 發表 Muse Spark:邁向「個人超級智慧」的新世代 AI 模型架構與實務判斷
Meta Superintelligence Labs 推出首款模型:Muse Spark。全面剖析其原生多模態推理機制、引發熱議的「沉思模式 (Contemplating Mode)」背後的測試期運算架構,以及在健康醫療領域的 RLHF 實踐。
- Meta Muse Image 是什麼?Agentic 圖像生成、可用範圍與工程限制
依 Meta 官方技術資料解析 Muse Image 的搜尋、程式工具、自我修正與 test-time compute,並釐清產品 availability、評測證據與導入限制。
- Nano Banana 2 Lite 與 Gemini Omni Flash:影像與影片生成的架構與影響
深入解析 Google 最新發布的 Nano Banana 2 Lite 圖像模型與 Gemini Omni Flash 影片生成編輯模型,探索它們如何以極致的速度、成本效益以及多模態整合,為開發者帶來全新可能。
- PixelRAG:Web 截圖擊敗文本檢索!百萬級像素原生 RAG 系統深度剖析
解讀 UC Berkeley 等機構提出的 PixelRAG 系統,剖析其定制 Chromium 渲染、GPU 加速預處理、LoRA 雙塔視覺嵌入與 Text Warmup 訓練配方,並教你如何將其實現為 Claude Code 的網頁視覺閱讀技能。
- BloomRender 操作手冊:從文字生圖到證件照、形象照、旅遊照與虛擬試穿
BloomRender 是以 Google Gemini 驅動的 AI 照片工作室。本篇詳述文字生圖、AI 證件照、編輯器微調、形象照、旅遊照與虛擬試穿的完整操作流程與建議學習路徑。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡