W 亂報 Re:Post · w.repost.tw · 自家機房排版印行
排版中
W 亂報 Re:Post · w.repost.tw · 自家機房排版印行
來源:影片畫面擷取自 YouTube/Techno Tim(07:24)
較長的測試改用 Tim 熟悉的 LittleLink Server。他建立沒有既有測試與 Git history 的副本,要求 coding agent 自行補測試。Run 5 產出 334 個測試、20 個測試檔與 24 個 suites;路由紀錄為 Nemotron 1,173 次、DeepSeek 165 次,合計 1,338 次,約 87.7% 留在較快模型。
87.7% 是 routing decisions 的比例,不是 token、執行時間或費用比例。兩個模型都跑在本機,也沒有固定模型的完整對照組;這只能說明多數回合留在 Nemotron,不能證明省下多少成本或提高多少成功率。
87.7% 是選擇次數,不是 token、時間或費用比例。
兩個模型都跑在本機,且沒有固定模型的完整對照組。

來源:影片畫面擷取自 YouTube/Techno Tim(11:34)
GitHub PR #904 明寫 Run 5「沒有成功完成」:終止狀態是 `CONTINUATION_LIMIT`,共 15 次 attempts、14 次 continuations;lint、typecheck 與 build 通過,但 acceptance 因 skipped test 被判定為 coverage gaming,也沒有產生要求的 final commit。該 PR 已關閉、未合併,只用來保留原始產物。
影片裡 Tim 表示,事後檢查認為 agent 沒有作弊,是 anti-gaming detector 誤報。兩份紀錄可以同時成立:作者事後認為產物沒有故意繞過測試,不代表正式 benchmark 已通過。把「做出大量測試」與「通過整套評估規則」分開,才不會把最接近成功的一輪寫成完整成功。
大量測試產物與正式 benchmark 通過是兩件事。
PR #904 保留了 CONTINUATION_LIMIT、coverage-gaming finding 與缺少 final commit 的紀錄。
Run 6 即使已經使用 DeepSeek,agent 仍會卡住。Switchyard 官方將 standalone server 定位為 demo、evaluation 與單人使用,不是 production proxy;Tim 的數據使用 v0.2.0,補充文章的部署範例則改用 v0.3.0,兩版路由行為已有變化。
這次實驗支持的是較窄也較實用的結論:只要能分辨 Stage selection、context overflow 與 backend failure,較快模型確實可以承擔多數回合。Switchyard 減少的是每回合手動選模型的負擔,不是自動完成工作的保證。要判斷它是否更便宜、更可靠,還需要 token 用量、成本與固定模型 baseline。
自動路由減少選模型的負擔,不能保證 agent 完成工作。
Run 6 已使用 capable model,仍然沒有繼續進展。
原文出處(5)
I Made My Local AI Pick Its Own Model
影片 · Techno Tim · youtube.com
14 分 29 秒影片
Automatic local AI model routing with NVIDIA Switchyard
文章 · Techno Tim · technotim.com
完整測試數據與設定
Switchyard
網站 · NVIDIA NeMo · github.com
官方路由策略與 standalone server 定位
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
網站 · NVIDIA · huggingface.co
官方 model card
LittleLink Switchyard Run 5 comparison
網站 · Techno Tim · github.com
Run 5 原始產物與正式評估狀態

影片 · Shorts

影片 · YouTube