AI Agent 融入工作流 · 2026.10 更新版
Rocco · 26.10.03 · 01 / 14
AI AGENTS IN THE WORKFLOW · 2026

AI Agent
融入 工作流

從雲端 Agent CLI、地端開源模型,到 VLM 讓機器「看見」——加上兩台 DGX Spark 的實戰數字。
Rocco · 內部使用經驗分享 · 2026.10.03
→ swipe / arrow keys
STARTING POINT
02 / 14
PART 01 · 起點

從 Web GUI 到 Agent 化

WEB GUI · 天花板
只能「動口」
貼上問題、複製回答。無法讀檔、無法執行、無法串接工具,上下文難以累積。
AGENT · 動手
真正「動手」
讀檔、執行、跑測試、串 Slack / Git / 本地服務。生產力來自讓 AI 直接動手。
→ 真正的生產力,是讓 AI 直接動手,而不只是動口
THE BIG THREE + THIRD PARTY
03 / 14
PART 02 · 生態 2026/10

Agent CLI 生態,一季又翻一輪

01
Claude Code
Anthropic 出品,9 月換上 Opus 5.5 / Sonnet 5.5;MCP / Skill / Subagent 生態最成熟。
02
Codex CLI
OpenAI 出品,9/29 起預設 GPT-6.1 Sol,沙箱化執行;自架端點只支援 Responses API。
03
Antigravity CLI
Google 5/19 推出的新 CLI(agy),非開源;Gemini CLI 6/18 起停供免費與個人訂閱。
04
omp(oh-my-pi)
pi 的活躍分支,自架端點一級公民,內建迴圈防護;我目前的主力。
05
OpenCode
開源 MIT、內建 OpenRouter,模型選擇彈性最大。
06
DeepSeek Harness
DeepSeek 官方,Everything is a Plugin;以 Web/桌面 App 為主,仍是開發者預覽。
AGENTS IN MY DAILY WORK
04 / 14
PART 02 · 工作流

Agent 怎麼融入我的日常

01
工作日誌當骨幹
每個專案一份 WORK-LOG(進度、待辦、解法)+ memory(決策、雷點),純文字、人也看得懂。
02
多台 Mac 接力
檔案自動同步、一次一台;收工 SAVE 寫交接檔,換機 LOAD 重新 brief,不靠對話紀錄。
03
雲端規劃,地端跑量
Claude 負責規劃與審查;續寫、整理交給地端模型,快速檔起草、思考檔把關。
04
讀網頁工具分工
公開網頁交給 Firecrawl;要登入、內網、網址帶 token 的,用自己的 Chrome,不外送。
05
研究代理要驗證
論壇追蹤 21 輪、124 串討論;代理的推論兩度上機被推翻 → 規則:先驗證再動手。
06
記憶不是越多越好
一次共享記憶實驗 83% 是工具迴圈的垃圾,模型還會重播失敗;改成索引+按需展開。
GOING LOCAL
05 / 14
PART 03 · 本地化

為什麼要本地化

01 雲端 · 創造
能力最強
旗艦模型、最新能力、零硬體門檻。但資料出本機、成本隨用量、長任務燒錢。
  • 資料送到雲端,隱私不可控
  • 長任務成本失控
  • 離線即斷
02 本地 · 守密
資料可控
資料不出本機、無 API 成本、離線可用、可實驗可調校。硬體門檻是代價。
  • 隱私可控,資料不出本機
  • 長任務跑到飽,零 API 成本
  • 離線可用,斷網也能工作
LOCAL CAPABILITY · WHAT A MAC CAN RUN
06 / 14
PART 03 · 硬體

一台 Mac 能跑什麼

16GB
9B
4-bit 小模型,已經能看圖
32GB
27–35B
27B 稠密或 35B-A3B MoE
64GB
70B
稠密 70B 偏慢,中型模型可開長上下文
128GB
120B
120B 級 MoE,LLM / VLM 主力
512GB
400B
M5 Ultra,400B 級 MoE
→ 關鍵是 4-bit 量化(INT4 / MXFP4 / NVFP4)+ MoE;macOS 預設只讓 GPU 用約 2/3~3/4 記憶體
LOCAL LOAD · OPEN MODELS
07 / 14
PART 03 · 載入

地端設備
載入開源模型

開源 LLM / VLM 已能在地端設備跑起來——關鍵是「載入」與「服務化」兩件事。
從量化權重、推理引擎、閘道,到 OpenAI 相容 API,一條鏈路打通。
APPLICATION LAYER
Agent / 應用
用 OpenAI 相容 API 呼叫,不綁特定模型。
GATEWAY LAYER
LiteLLM 閘道
別名、權限、限流、在地化——下一頁說明為什麼需要它。
ENGINE LAYER
vLLM · SGLang · llama.cpp · Ollama
開源推理引擎,載入量化權重,對外提供標準 API。
MODEL LAYER
開源 LLM + VLM
Qwen3.5–3.8 / GLM-5.3 / DeepSeek V4 / Gemma 4 / Nemotron 3,4-bit / FP8 / NVFP4。
WHY A GATEWAY
08 / 14
PART 03 · 閘道

為什麼中間要放一層閘道

01
模型別名
客戶端只認別名。後端從 DeepSeek 換成 GLM,所有工具一行設定都不用改。
02
推理強度分檔
同一個模型開 fast / 一般 / thinking / 正式四個檔,依任務挑,不用每個工具各自設定。
03
繁中把關
輸出統一轉台灣正體。教訓:手寫詞表會把「採購項目」誤改成「採購專案」,正式文件要用保守轉換。
04
金鑰與權限
每把金鑰只開放指定別名,可以單獨撤銷、輪替,不必動到其他人。
05
限流與排隊
地端一次只能同時處理少量請求。曾有服務繞過閘道直連引擎,佇列塞滿,首字延遲從 2 秒拉到 60 秒。
06
閘道本身也要監控
格式轉換失敗被當成上游故障,整個模型冷卻 10 分鐘、所有工具一起卡住。
CASE · DGX SPARK ×2
09 / 14
PART 03 · 實戰

兩台 DGX Spark
合跑一個大模型

GLM-5.3-Flash(320B MoE、NVFP4 約 188GB)切成兩半,經高速直連線分給兩台一起算,再用 MTP 一次預猜 3 個 token。
瓶頸是記憶體頻寬(每台 273 GB/s),不是算力。
SPEED
32–45 tok/s
單一請求的輸出速度:JSON 最快、散文最慢。
CONTEXT
1M 上限 · 日常 256K
900K 首字要等約 9 分鐘,日常工具設在 256K。
QUALITY
工具呼叫 90.7 分
92 題評測,NVIDIA 官方版 91.4,同一級;兩路併發不掉分。
LESSON
健康檢查全綠 ≠ 活著
引擎死了 8 小時,/health 仍回 200 → 加 watchdog 掃日誌。
VLM QUALITY · 2026/10
10 / 14
PART 04 · VLM 排名

開源 VLM 排名

GLM-5.3-Flash
1278 · 開源第一
Kimi K2.6
1265 · 1T MoE
Gemma 4 31B
1262 · 筆電可跑
MiMo-V2.6
1247 · 小米
Qwen3.5 / 3.6 / 3.8
1247 · 0.8B–397B
MiniMax M3
1237 · 1M 上下文
→ LMArena Vision 2026/10/02;第 2 名以後差距在誤差內。專門用途另看:影片 Cosmos 3、OCR 用 PaddleOCR-VL
VISION LANGUAGE MODEL
11 / 14
PART 04 · VLM

VLM:讓模型「看見」

LLM · 只看文字
讀不懂圖
只能處理文字輸入。圖片、影片、畫面,對它來說是「盲區」。
VLM · 看得見
圖文皆懂
同時理解影像與文字。能看圖、看影片、做視覺問答、產生摘要——把「視覺」變成可查詢的資料。
→ VLM 讓機器從「讀文字」進化到「看世界」
VLM USE CASES
12 / 14
PART 04 · VLM 應用

VLM 到底能做什麼

01
看圖問答
「這張圖裡有什麼?」「這個場景發生什麼事?」
02
文件 / 表格理解
PDF、發票、截圖、圖表,直接讀取內容。
03
影片摘要
幾小時影片 → 重點摘要、關鍵片段。
04
視覺搜尋
用文字找畫面:「穿紅衣的人在哪個片段」。
05
異常偵測
監控畫面找異常、驗證警報、降低誤報。
06
OCR
把圖片 / 截圖轉成可搜尋的文字。
CASE · NVIDIA VSS
13 / 14
PART 04 · VLM 範例

影片搜尋
與摘要

NVIDIA 官方 Blueprint(VSS):用 VLM + LLM + RAG 打造影片分析 agent,自然語言搜尋、摘要、視覺問答。
9/29 推出 3.3 版:一句話就能建部署,長影片摘要的 VLM 用量少 80%。
AGENT LAYER
VSS Agent · MCP
自然語言搜尋、視覺問答、摘要;每個元件都有 MCP 介面,也提供 Agent Skills。
ANALYTICS LAYER
RAG + Embeddings
影片嵌入、軌跡、事件、警報驗證,metadata 富化。
VISION LAYER
VLM + NIM
Cosmos3 Nano Reasoner 看影片,Nemotron Nano 9B v2 推理。
GETTING STARTED
14 / 14
PART 05 · 行動

你可以怎麼開始

STEP 01裝 Ollama / LM StudioMac 版已改用 MLX 引擎
STEP 02跑一個小 VLMQwen3.5-9B / Gemma 4 E4B,16GB 就夠
STEP 03丟圖給它截圖、文件、照片都行
STEP 04引擎 + 閘道vLLM / SGLang 上伺服器,前面放 LiteLLM
STEP 05雲端 + 地端雲端規劃審查,地端跑量
→ 地端不是全有或全無——先從一台機器、一個模型開始