---
title: "用一個測試揀出「日常助手」與「工作主力」：實測比較五大 AI 工具"
url: https://sammy.hk/%e7%94%a8%e4%b8%80%e5%80%8b%e6%b8%ac%e8%a9%a6%e6%8f%80%e5%87%ba%e3%80%8c%e6%97%a5%e5%b8%b8%e5%8a%a9%e6%89%8b%e3%80%8d%e8%88%87%e3%80%8c%e5%b7%a5%e4%bd%9c%e4%b8%bb%e5%8a%9b%e3%80%8d%ef%bc%9a%e5%af%a6/
author: Ethan
published: 2026-10-03T20:23:00+08:00
modified: 2026-10-03T09:02:29+08:00
description: "市面上的 AI 助手越出越多，訂閱費用也不斷累積。The Rundown 的指南提出一套可自行執行的比較方法：以自己的真實任務測試多個前沿模型，再用一張試算表決定哪些訂閱值得保留。本文整理指南的方法與步驟；由於內容涉及第三方教學，除官方公告外本文不作來源引證。 目標與前置準備 指南的目標，是讓使用者在自己真正會做的任務…"
categories: [AI]
tags: ["AI 工具比較", ChatGPT, Claude, Gemini, OpenRouter, "訂閱選擇"]
source: https://sammy.hk
---
![Comparison of 5 major AI tools showing daily assistant vs workhorse models](https://sammy.hk/wp-content/uploads/2026/10/openrouter_google_gemini-3_1-flash-lite-image_20261003_090104_2fa2e736-1024x572.jpg)市面上的 AI 助手越出越多，訂閱費用也不斷累積。The Rundown 的指南提出一套可自行執行的比較方法：以自己的真實任務測試多個前沿模型，再用一張試算表決定哪些訂閱值得保留。本文整理指南的方法與步驟；由於內容涉及第三方教學，除官方公告外本文不作來源引證。

## 目標與前置準備

指南的目標，是讓使用者在自己真正會做的任務上比較人工智能模型，並決定哪些訂閱值得付費；過程中會建立一張記錄表、模型評分與值得保留工具的試算表，並保存提示供日後新模型推出時重用。適用對象包括同時付費使用多個工具、想知道哪些真正需要的人；需要可核查工作簡報與研究的管理者或顧問；以及首次選擇訂閱、想先試後付的使用者。

前置條件包括：一個 OpenRouter 帳戶及付費模型所需的額度、試算表檔、一個你能自行判斷好壞的日常任務與一個工作任務，以及你正在考慮的應用程式（供後續測試之用）。

## 建立任務與評分表

指南建議先列出常做的任務，由一個日常任務和一個工作任務開始。對每項任務記下：多頻做一次、理想結果是什麼、目前使用慣用工具（若還在選擇可留空）。示範中，日常任務選了晚餐規劃（要求容易跟隨的食譜），工作任務則是一份給上司的報告（要求數字正確、建議有用）。

訂閱費用另開一張分頁記錄每月開支，避免同一計劃在多個任務中重複計算。使用者也可請 AI 代為建立這張表，指南提供了一段可改寫的提示，要求表格包含任務頻率、理想結果、現用工具、依「跟隨指示、清晰度、語氣」評分的欄位、格式與需要修正之處的備註、以及可保存提示的欄位，以便在每項任務中指定主要與備用工具。

## 以 OpenRouter 並排比較

指南指出，可在 OpenRouter 的比較頁面選取「混合模型」，取得來自 OpenAI、Anthropic 與 Google 的現行旗艦模型，再於 OpenRouter Chat 登入並在對話測試場選取那些模型，把同一段提示送給多個模型並排閱讀回答；示範中還加入了 Muse 與 Grok。指南建議在表中記錄實際模型名稱，並提醒付費模型需要先加值，費用與試用程式分開計算。

指南提供一個成本參考：詢次短測試每個回饋只需數美分，一次簡短比較的預算約為 25 美分，實際取決於模型與輸出長度。

## 提示的寬法與示範任務

指南建議挑戰一個常做的任務，寬出包含腳本、限制與期望寬法的提示，並在每個任務中開新對話。示範提供三類可改寫的提示，包括晚餐規劃（45 分鐘，指定材料與廚具、不購物、不加其他材料、要求時間表與禮量寬在步驟內、避免平淡或出水、以冷凍麵包朋友的口吻、300 字以內、不提供替代餐廳），以及由互相矛盾的筆記整理決策簡報（只可使用所提供的事實），還有由 Anthropic 官方的提示工程範例。

指南還提示多項實務細節：把未完成的回答標記為 DNF（未完成）並重跑，之後才判斷是否屬於常見問題；在評分之際要核對事實，因為「易讀但預算錯了」比餐一分鐘更有用；如重視速度也記錄速度。示範中的觀察包括晚餐測試稱「無結論」（因為沒有真正的火），Muse 的研究回答下拉選項受歡迎，而 Grok 在聊任務輸出一大片文字，其晚餐回答亦未完成。

## 由測試到選擇訂閱

指南建議測試五項任務、每天一項，使用自己真正會問的問題與期望 AI 協助的工作，為每項任務選定主要工具，必要時加上在主要工具較弱的環節佈署的備用工具。

其後再在打算保留的應用程式中再試一次，因為在 ChatGPT、Claude 或 Gemini 的頻道可能與 OpenRouter 不同：使用自己帳戶可用的模型、試用自己的對話與追問，觀察是否符合需要。最後檢查訂閱是否重複：若一個應用同時涵蓋日常與工作任務，或可削減重複的計劃；首次選擇訂閱者也可藉這套測試決定哪個應用值得付費。

## 適用範圍與注意

這套方法的基礎是以使用者自身任務作為評分標準，因此結果因人而異，並非通用排名；示範中的觀察（例如某模型在特定任務的表現）只反映指次測試的設定與提示。指南又強調要保存提示與評分，日後新模型推出時可用同一組提示重新比較。

### 相關文章：

1. [揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter](https://sammy.hk/%e6%8f%ad%e9%96%8b%e3%80%8cox-alpha%e3%80%8d%e4%b9%8b%e8%ac%8e%ef%bc%9a%e6%99%ba%e8%ad%9c-z-ai-%e7%9a%84-glm-5-3-flash-%e5%a6%82%e4%bd%95%e4%bb%a5%e5%8c%bf%e5%90%8d%e4%b9%8b%e5%a7%bf%e6%94%bb%e9%99%b7/ "揭開「Ox Alpha」之謎：智譜 Z.ai 的 GLM-5.3-Flash 如何以匿名之姿攻陷 OpenRouter")
2. [Google 推出 Sheets canvas：一句話將試算表變成互動迷你應用](https://sammy.hk/google-%e6%8e%a8%e5%87%ba-sheets-canvas%ef%bc%9a%e4%b8%80%e5%8f%a5%e8%a9%b1%e5%b0%87%e8%a9%a6%e7%ae%97%e8%a1%a8%e8%ae%8a%e6%88%90%e4%ba%92%e5%8b%95%e8%bf%b7%e4%bd%a0%e6%87%89%e7%94%a8/ "Google 推出 Sheets canvas：一句話將試算表變成互動迷你應用")
3. [用「Loop 方法」改善 ChatGPT 的重複性工作流程](https://sammy.hk/%e7%94%a8%e3%80%8cloop-%e6%96%b9%e6%b3%95%e3%80%8d%e6%94%b9%e5%96%84-chatgpt-%e7%9a%84%e9%87%8d%e8%a4%87%e6%80%a7%e5%b7%a5%e4%bd%9c%e6%b5%81%e7%a8%8b/ "用「Loop 方法」改善 ChatGPT 的重複性工作流程")
4. [開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside](https://sammy.hk/%e9%96%8b%e6%94%be%e6%ac%8a%e9%87%8d-ai-%e6%88%90%e7%82%ba%e7%9f%bd%e8%b0%b7%e6%9c%80%e6%90%b6%e6%89%8b%e8%b3%87%e7%94%a2%ef%bc%9astripe-%e6%94%b6%e8%b3%bc-openrouter%e3%80%81nvidia-%e9%87%8d%e9%87%91/ "開放權重 AI 成為矽谷最搶手資產：Stripe 收購 OpenRouter、Nvidia 重金押注 Poolside")
