標籤: Data Engineering
此標籤的文章
- Kumo Tabular:用合成表格預訓練,讓新任務從範例開始
NVIDIA Kumo Tabular 把表格預測改成 in-context learning:模型先在合成表格上預訓練,再從標記列預測新資料;本文拆解方法、榜單主張與企業驗證條件。
- Google Cloud Data Agent Kit:Skills、MCP 與資料工作流導入指南
釐清 Data Agent Kit 的 preview 定位、開源 artifact、Skills/MCP/plugins 架構,以及企業資料團隊在權限、成本、驗證與 incident recovery 上的責任。
- Kaggle Titanic:從 0.74 到 0.816,特徵工程比調參重要
鐵達尼號生存預測競賽的完整實戰紀錄:漸進式特徵工程、CatBoost 與 RF 集成、CV 與 Public LB 脫鉤、嚴格 notebook 移植,以及何時該停手。最終 Public LB 0.81578。
歡迎演講、企業內部技術分享與架構交流;可以先查看我適合分享的主題與公開工程成果。
演講與聯絡