
市面上的 AI 助手越出越多,訂閱費用也不斷累積。The Rundown 的指南提出一套可自行執行的比較方法:以自己的真實任務測試多個前沿模型,再用一張試算表決定哪些訂閱值得保留。本文整理指南的方法與步驟;由於內容涉及第三方教學,除官方公告外本文不作來源引證。
目標與前置準備
指南的目標,是讓使用者在自己真正會做的任務上比較人工智能模型,並決定哪些訂閱值得付費;過程中會建立一張記錄表、模型評分與值得保留工具的試算表,並保存提示供日後新模型推出時重用。適用對象包括同時付費使用多個工具、想知道哪些真正需要的人;需要可核查工作簡報與研究的管理者或顧問;以及首次選擇訂閱、想先試後付的使用者。
前置條件包括:一個 OpenRouter 帳戶及付費模型所需的額度、試算表檔、一個你能自行判斷好壞的日常任務與一個工作任務,以及你正在考慮的應用程式(供後續測試之用)。
建立任務與評分表
指南建議先列出常做的任務,由一個日常任務和一個工作任務開始。對每項任務記下:多頻做一次、理想結果是什麼、目前使用慣用工具(若還在選擇可留空)。示範中,日常任務選了晚餐規劃(要求容易跟隨的食譜),工作任務則是一份給上司的報告(要求數字正確、建議有用)。
訂閱費用另開一張分頁記錄每月開支,避免同一計劃在多個任務中重複計算。使用者也可請 AI 代為建立這張表,指南提供了一段可改寫的提示,要求表格包含任務頻率、理想結果、現用工具、依「跟隨指示、清晰度、語氣」評分的欄位、格式與需要修正之處的備註、以及可保存提示的欄位,以便在每項任務中指定主要與備用工具。
以 OpenRouter 並排比較
指南指出,可在 OpenRouter 的比較頁面選取「混合模型」,取得來自 OpenAI、Anthropic 與 Google 的現行旗艦模型,再於 OpenRouter Chat 登入並在對話測試場選取那些模型,把同一段提示送給多個模型並排閱讀回答;示範中還加入了 Muse 與 Grok。指南建議在表中記錄實際模型名稱,並提醒付費模型需要先加值,費用與試用程式分開計算。
指南提供一個成本參考:詢次短測試每個回饋只需數美分,一次簡短比較的預算約為 25 美分,實際取決於模型與輸出長度。
提示的寬法與示範任務
指南建議挑戰一個常做的任務,寬出包含腳本、限制與期望寬法的提示,並在每個任務中開新對話。示範提供三類可改寫的提示,包括晚餐規劃(45 分鐘,指定材料與廚具、不購物、不加其他材料、要求時間表與禮量寬在步驟內、避免平淡或出水、以冷凍麵包朋友的口吻、300 字以內、不提供替代餐廳),以及由互相矛盾的筆記整理決策簡報(只可使用所提供的事實),還有由 Anthropic 官方的提示工程範例。
指南還提示多項實務細節:把未完成的回答標記為 DNF(未完成)並重跑,之後才判斷是否屬於常見問題;在評分之際要核對事實,因為「易讀但預算錯了」比餐一分鐘更有用;如重視速度也記錄速度。示範中的觀察包括晚餐測試稱「無結論」(因為沒有真正的火),Muse 的研究回答下拉選項受歡迎,而 Grok 在聊任務輸出一大片文字,其晚餐回答亦未完成。
由測試到選擇訂閱
指南建議測試五項任務、每天一項,使用自己真正會問的問題與期望 AI 協助的工作,為每項任務選定主要工具,必要時加上在主要工具較弱的環節佈署的備用工具。
其後再在打算保留的應用程式中再試一次,因為在 ChatGPT、Claude 或 Gemini 的頻道可能與 OpenRouter 不同:使用自己帳戶可用的模型、試用自己的對話與追問,觀察是否符合需要。最後檢查訂閱是否重複:若一個應用同時涵蓋日常與工作任務,或可削減重複的計劃;首次選擇訂閱者也可藉這套測試決定哪個應用值得付費。
適用範圍與注意
這套方法的基礎是以使用者自身任務作為評分標準,因此結果因人而異,並非通用排名;示範中的觀察(例如某模型在特定任務的表現)只反映指次測試的設定與提示。指南又強調要保存提示與評分,日後新模型推出時可用同一組提示重新比較。