
OpenHands vs Devin vs Manus:2026 年誠實選購指南(以及為何 Manus 剛被 Meta 收購)
關於 OpenHands vs Devin vs Manus 的簡短結論是:並沒有唯一的贏家,而且這三者中的一個甚至已不再是獨立公司。Meta 以超過 20 億美元的價格收購了 Manus(母公司為 Butterfly Effect),該交易於 2025 年 12 月 30 日左右完成。因此,你真正要問的不是「哪個最好」,而是「哪個最符合我最大的單一限制條件?」由 All Hands AI 開發的 OpenHands 是開源首選;Cognition 推出的 Devin 是一款每月費用介於 20 至 500 美元的一站式付費工程師;Manus 則專注於建構完整應用程式。請根據你的限制條件而非炒作熱度來選擇。
這三者都是自主編碼 AI 代理(autonomous coding agents),但它們玩的遊戲不同。OpenHands 是開源且可自託管的(MIT 授權,運行免費,搭配 Claude 時 SWE-bench Verified 分數約為 72%)。Devin 是 Cognition 推出的放手型工程師(基於 ACU 計費,每月 20 至 500 美元)。Manus 是一款全能型應用程式建構工具,現在已是 Meta 的資產。若你需要控制權,選 OpenHands;若想委派任務,選 Devin;若需生成完整應用程式,選 Manus。
快速結論:
- OpenHands: 開源、可自託管、運行免費(僅需支付模型 API 費用);搭配 Claude 時 SWE-bench Verified 分數約 72%。適合重視控制權者。
- Devin: Cognition 推出的一站式付費工程師;每月 20 至 500 美元,基於 ACU 計費;提供最高程度的放手型自主性。適合想委派任務者。
- Manus: 全能型應用程式建構工具,基於點數計費;於 2025 年 12 月被 Meta 收購。適合端到端應用程式生成,但需注意潛在變數。
- 沒有通用贏家。 這取決於你最大的單一限制條件:控制權、放手型自主性,或是完整應用程式生成能力。
快速結論:這三者你該選哪一個?
OpenHands、Devin 和 Manus 是三款自主 AI 編碼代理。OpenHands 是開源且可自託管的(免費、MIT 授權,搭配 Claude 時 SWE-bench Verified 分數約 72%)。Devin 是 Cognition 推出的一站式付費工程師(每月 20 至 500 美元,基於 ACU 計費)。Manus 是一款全能型應用程式建構工具,現由 Meta 擁有。若你需要控制權,選 OpenHands;若想獲得放手型自主性,選 Devin;若需生成完整應用程式,選 Manus。
那麼該如何實際選擇呢?從你最大的單一限制條件出發,答案自然浮現:
- 如果你想要控制權,請選 OpenHands: 自託管、使用自己的模型、無每位用戶的綁定限制,並擁有開源領域中最高的 SWE-bench 分數。
- 如果你想委派整個任務且幾乎無需監看,請選 Devin: 它是三者中最不需人工介入的,並已整合 Jira、Linear 和 Slack。
- 如果你想端到端建構完整應用程式(資料庫、付款、部署)而非進行細微的儲存庫修復,請選 Manus: 只是要先評估 Meta 路線圖的不確定性。
這裡沒有通用的贏家。正確的自主編碼 AI 代理是那個符合你最大單一限制條件的工具:控制權、自主性,或完整應用程式生成能力。如果你在尋找更廣泛的名單(如 Claude Code、Cursor、Codex、Aider、OpenClaw),請參閱 完整的 12 款代理排名。本文將專注於這三款工具的比較。
OpenHands vs Devin vs Manus 一覽表(比較表)
這張表格是快速並排閱讀這三者差異的最快方式。在瀏覽之前有一件事需要標註:Manus 的基準測試使用的是 GAIA,而非 SWE-bench,因為它是一個應用程式建構工具,而非儲存庫手術工具。強行將 SWE-bench 數據套用在它身上是不誠實的,因此表格中會如实說明。下方的每個基準測試數據都標明了其評估變體(Verified)和所使用的模型。
| 維度 | OpenHands | Devin | Manus |
|---|---|---|---|
| 類型 | 開源代理框架 | 一站式自主工程師 | 全能型應用程式建構代理 |
| 公司 / 所屬方 | All Hands AI | Cognition | Meta(2025 年 12 月收購) |
| 授權條款 | MIT(開源) | 專有 | 專有 |
| 定價模式 | 自託管免費(+ 模型 API 成本) | 基於 ACU(Core $20 / Team $500) | 基於點數($0 免費 → $200/月) |
| SWE-bench Verified | ~72%(搭配 Claude / CodeAct) | ~45–50%(2.x 版本;2024 發布時為 13.86%) | 基準測試使用 GAIA,非 SWE-bench |
| 自託管 / 離線運作 | 是(完全控制) | 否 | 否 |
| 模型選擇 (BYOM) | 是(OpenRouter / Ollama / 直接連接) | 否(由 Cognition 管理) | 否(由 Meta/管理方管理) |
| 最佳任務類型 | 儲存庫手術、錯誤修復、PR | 放手型多步驟工程任務 | 完整應用程式生成、瀏覽+建構 |
| 人類介入循環 | 可配置 | 可配置,大多為放手型 | 可配置 |
| 沙盒隔離 | 是(Docker) | 是(受管理) | 是(受管理) |
| 最適合 | 需要控制權 + 無每位用戶綁定的團隊 | 委派整個任務的團隊 | 端到端應用程式/網站建構 |
數據截至 2026 年 6 月 6 日,經 swebench.com、devin.ai/pricing 和 openhands.dev 驗證。

OpenHands:開源、自託管選項
OpenHands 是由 All Hands AI 開發的開源自主編碼 AI 代理。它採用 MIT 授權,自託管免費(你只需支付模型 API 推理費用),當在其 CodeAct 設定下搭配 Claude 使用时,SWE-bench Verified 分數約為 72%。根據 swebench.com 排行榜,這是 2026 年開源代理框架中的最高分數。
如果這個名字聽起來很熟悉,那是因為它以前叫做 OpenDevin。All Hands AI 於 2024 年底將其重新命名為 OpenHands。該項目在 GitHub 上擁有超過 7 萬顆星,背後有一個真實的社群支持,這比聽起來更重要:對於開源代理來說,問題追蹤器就是你的支援專線。
其headline功能是 BYOM(Bring Your Own Model,自帶模型)。你不會被鎖定在單一供應商。你可以透過 OpenRouter 運行它,直接呼叫 API,或者將其指向本地的 Ollama 模型以實現完全離線運作。(想知道詳細細節?這裡有 如何在你自己的模型上運行 OpenHands 的指南。)你也可以從終端機訪問它:openhands CLI 讓你在不接觸網頁介面的情況下啟動任務,這在 CI 流程中非常方便。它能乾淨地融入更廣泛的 代理框架 生態系統,並且你可以 透過 MCP 將其連接 以進行自訂工具整合。
如果你不想託管任何東西,還有帶有免費層級(MiniMax 模型)的 OpenHands Cloud。企業級自託管路徑(包含 Kubernetes 和 RBAC)则需要商業授權。
誠實的限制: 這並不是一站式解決方案。你需要承擔設置稅。Docker、模型配置、需要監看的沙盒,而且你要自己負責推理帳單,當長時間的 Claude 運行出錯時,費用可能會悄悄累積。如果「無基礎設施工作」是不可妥協的条件,OpenHands 不是你的選擇。
如果你重視控制權、自託管和模型選擇勝過便利性,請選 OpenHands。
Devin:一站式自主工程師
Devin 是 Cognition 推出的一站式自主工程師。你交給它一個任務,它會規劃、編碼、測試並開啟 PR,幾乎不需要人工指導。定價是 基於 ACU(Agent Compute Unit,代理計算單元),Core 方案起價為每月 20 美元,Team 方案為每月 500 美元,並且它可以直接插入 Jira、Linear 和 Slack。它是三者中最不需人工介入的。
什麼是 ACU?一個 代理計算單元 大約等於 15 分鐘的主動自主工作時間。Core 方案(每月 20 美元)包含超額費用約每 ACU 2.25 美元,並有 10 個會話的上限。Team 方案(每月 500 美元)捆綁了 250 個 ACU,每 ACU 約 2.00 美元,並提供無限併發會話,這正是團隊願意付費的真正原因:你可以讓 Devin 同時處理五張工單。企業方案則是客製化的(VPC、SSO、管理員控制)。所有當前資訊均來自 devin.ai/pricing。
現在來談談基準測試的問題,因為這常讓人困惑。在 2024 年發布時,Devin 的 SWE-bench 得分為 13.86%。這個數字至今仍漂浮在各個部落格中,彷彿它是最新的。其實不然。Devin 2.x 目前的 SWE-bench Verified 分數約為 45–50%(引用前請務必在 swebench.com 上驗證)。Cognition 一直公開表示,他們優化的是現實世界的可用性而非基準測試分數,因此 Devin 的 headline 數字與開源領導者之間的差距部分是故意的定位策略,而非純粹的能力問題。如果你只運行異步任務,也請閱讀我們關於 背景與內嵌代理比較 的看法。
誠實的限制: ACU 模式意味著成本會隨使用量增加,失控的代理會迅速燒掉預算。它不如開源選項透明,且無法自託管。Cognition 運行什麼,你就得到什麼。
如果你想委派整個工程任務並卸下監看責任,請選 Devin。
Manus:也會編碼的全能型代理(以及 Meta 問題)
Manus 是一款恰好會編碼的全能型自主代理。它規劃多步驟任務、瀏覽即時網頁、編寫並運行代碼,並端到端地建構完整 Web 應用程式(資料庫、Stripe、SEO)。定價是 基於點數,其基準測試使用的是 GAIA,而非 SWE-bench。截至 2025 年 12 月下旬,它已成為 Meta 的資產。我們在下方詳細說明 Meta 交易對你建構決策的影響。
GAIA 與 SWE-bench 的區別是 Manus 故事的整體核心。SWE-bench 衡量的是儲存庫手術:代理能否修復現有代碼庫中的真實錯誤並通過測試?GAIA 衡量的是全能型任務完成度:代理能否規劃、瀏覽並執行多步驟工作?Manus 是為後者而建的。詢問它在 SWE-bench 上的表現,就像要求總包商進行牙科手術一樣。工具錯誤,測試也錯誤。
關於點數:免費層級為 0 美元,每日刷新 300 點。標準方案為每月 20 美元(約 4,000 點),可客製化方案為每月 40 美元(約 8,000 點),擴展方案為每月 200 美元(約 40,000 點),團隊方案起價為每席位 20 美元。點數消耗隨任務複雜度而定。一個約 25 分鐘的網站建構任務大約消耗 360 點,因此任務越大,點數消耗越快。有一個注意事項:定價可能在 Meta 收購後有所變動。請將路線圖視為由 Meta 決定。
誠實的限制: Manus 不是儲存庫手術工具。如果你的工作是「修復我們 monorepo 中失敗的測試」,那它就不合適。複雜建構會快速消耗點數。還有最重要的一點:由於現在是 Meta 的決定而非一家精簡初創公司的決定,其獨立路線圖和定價變得不确定。
如果你想端到端建構完整應用程式或網站,並且能忍受收購後的不確定性,請選 Manus。
OpenHands、Devin 和 Manus 在日常使用中的實際感受
將 OpenHands(自託管,自帶 Claude)和 Devin 放在同一類工作上,例如修復失敗的測試並開啟一個乾淨的 PR,重要的差距不在於準確性,而在於各自需要多少監看。
OpenHands 一旦配置完成,速度快且透明。你可以觀察它的推理過程,看到每一個 shell 命令,當它出錯時,你能确切知道問題所在。代價是配置:你需要啟動 Docker,連接 Claude 金鑰,並監控推理儀表板。對於一行測試修復來說,這是額外負擔。對於每週運行數十次此類任務並希望獲得完全可見性的團隊來說,這種負擔是值得的。
Devin 則是相反的交易。你撰寫一張工單,然後離開,回來時就會看到一個 PR。需要監看的內容較少,當它 stumble 時需要除錯的內容也較少,但 ACU 計時器一直在走。對於簡單的修復,這感覺像是用叉車打蒼蠅;對於棘手的多文件任務,這正是你付費購買的自主性。
Manus 是完全不同形狀的工具,這也是整個比較的關鍵不對稱之處。將它指向「建構並部署小型應用程式」而非「修復儲存庫錯誤」,它會交付一個帶有資料庫的工作應用程式,這類端到端建構是 OpenHands 或 Devin 傾向過度工程化的領域。將任務切換為手術式儲存庫工作,Manus 就不合適了。教訓不是「X 最好」。而是 任務形狀在任何基準測試之前就決定了工具。
Meta 收購對 Manus 用戶意味著什麼?
Meta 收購了 Manus(母公司 Butterfly Effect),交易價值超過 20 億美元,在大約 10 天內達成協議,並於 2025 年 12 月 29–30 日左右完成。Meta 表示沒有持續的中國所有權,且 Manus 將停止在中國運營。這是競爭對手比較文章中未提及的事實,所以這裡提供實際解讀。
時間軸:Butterfly Effect 於 2022 年在北京成立,並在交易前於 2025 年中遷至新加坡。此次收購由 CNBC、TechCrunch 和 Bloomberg 報導,退出中國的細節由 Fortune 涵蓋。
那麼你在 2026 年還能繼續在 Manus 上建構嗎?截至 2026 年中,是的。但在你承諾工作流程之前,請認真看待這一點:Manus 沒有消失,它成為了 Meta 的資產,這意味著其路線圖和定價現在由 Meta 決定,而非獨立初創公司。大型公司收購通常有三種結果:產品被整合到平台中、重新品牌化,或悄悄停止服務。如果你圍繞著獨立工具建立了業務流程,這些結果都不太好。請权衡這種綁定風險與便利性。
何時不應該使用每一款?(以及如何回滾糟糕的代理 PR)
誠實的「不要使用」清單:如果你對基礎設施設置毫無興趣,不要使用 OpenHands。 如果你的使用頻率偶爾,不要使用 Devin,因為 ACU 消耗划不來。如果是進行手術式儲存庫錯誤修復,或者收購不確定性是核心工作流程的致命傷,不要使用 Manus。
有一些值得知道的特定失敗模式。OpenHands 可能會因沙盒配置錯誤或意外依賴項而停滯,由於你是自託管,深夜除錯的是你自己。Devin 可能會自信地產生一個看似合理但錯誤的 PR,並悄悄地花費 ACU 來完成它,所以要審查每個差異。Manus 可能會過度建構(你要求一個表單,你得到了一個帶有未經請求的身份驗證功能的完整應用程式),且複雜建構會快速消耗點數。
使用任何代理時最聰明的安全措施是什麼?將其輸出視為初級開發人員的第一個 PR。始終在專用分支上運行代理,絕不直接推送到 main,並預設保持 人類介入循環 審查閘門開啟。如果運行出錯,回滾只需一個命令:
git revert <bad-commit> # or: git checkout main && git branch -D agent/feature-x將其與分支保護配對,這樣沒有代理人員批准,代理就無法合併。很無聊,是的。但這也是幫助你的代理與導致無人察覺直到週一的週五晚間回歸錯誤的代理之間的差別。
決策矩陣:如果…請選這個
停止比較功能列表,從你最大的單一限制條件開始。在左欄找到你的限制條件,選擇結果自然浮現。這就是回報:一個誠實的映射,而不是三個行銷頁面。
| 你最大的限制條件 | 選擇 | 原因 |
|---|---|---|
| 數據控制 / 無每位用戶綁定 / 離線 | OpenHands | MIT、自託管、BYOM:你擁有堆疊和帳單 |
| 放手型委派整個工程任務 | Devin | 最自主;ACU 模式隨使用量擴展 |
| 端到端建構完整應用程式/網站(DB、Stripe、部署) | Manus | 應用程式建構器形狀,但需权衡 Meta 路線圖不確定性 |
| 預算緊縮 / 實驗性質 | OpenHands 免費版 或 Manus 免費層級 | 0 美元入門;僅在擴展時付費 |
| 基準測試中最高的代碼修復準確率 | 搭配 Claude 的 OpenHands | ~72% SWE-bench Verified,開源頂尖 |
| 需要供應商 SLA + 企業級 SSO/VPC | Devin 企業版 | 受管理、一站式、合約支持 |

如果兩個限制條件持平,权衡你無法改變的那一個。你總是可以在以後更換模型或升級方案。一旦團隊的工作流程依賴於自託管承諾或供應商綁定,就很難輕易撤銷選擇。
Techsy 如何為客戶工作選擇自主代理
當我們為客戶項目選擇自主編碼代理時,我們不是從排行榜開始。我們從一個問題開始:這個客戶需要控制權、委派還是應用程式生成?根據我們的經驗,受監管的客戶和厭惡每位用戶綁定的團隊會選擇自託管的 OpenHands。想要 handing off 整個工單且不想思考的團隊會選擇 Devin。快速發布 v1 版本的創始人傾向於選擇像 Manus 這樣的應用程式建構器,並明確說明收購注意事項。
我們在客戶工作中看到的模式:基準測試差距不如任務形狀和團隊對設置的容忍度重要。如果你想獲得關於哪個適合你堆疊的第二意見,獲取免費諮詢,我們將為你詳細介紹。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的聯合創始人,該團隊為 B2B 客戶交付 AI 代理、自動化系統和語音/SDR 管道。他就讀於伯明翰大學,並撰寫有關 Techsy 團隊在生產環境中實際使用的 LLM 工具堆疊的文章。在 LinkedIn 上聯繫他。
常見問題
OpenHands 真的和 Devin 一樣好嗎?
這取決於你衡量什麼。在 SWE-bench Verified 上,搭配 Claude 的 OpenHands 得分更高(~72% vs Devin 的 ~45–50%)。但 Devin 在放手型自主性和內建的 Jira/Linear/Slack 整合方面獲勝。如果你重視原始基準準確率和控制權,OpenHands 略勝一籌。如果你重視零設置和委派,Devin 更好。
Meta 收購後 Manus 仍然可用嗎?你還能在上面建構嗎?
截至 2026 年中,是的,Manus 仍然可用,你可以在上面建構。但 Meta 於 2025 年 12 月收購了它,所以其路線圖和定價現在由 Meta 決定。被收購的產品可能被整合、重新品牌化或停止服務。在將核心工作流程承諾給它之前,請权衡這種綁定風險。
哪一個更便宜:OpenHands、Devin 還是 Manus?
OpenHands 自託管免費,但你需支付模型推理費用。Manus 有一個 0 美元的免費層級,每日 300 點。Devin 起價為每月 20 美元。規模下的最便宜選項取決於你的使用形狀:重度儲存庫工作有利於 OpenHands,偶爾任務有利於免費層級,團隊委派可以證明 Devin 每月 500 美元的 Team 方案是合理的。
OpenHands 可以完全離線/自託管運行嗎?
是的。OpenHands 採用 MIT 授權且可自託管,你可以透過 Ollama 將其指向本地模型以實現完全離線運作。這是它相對於 Devin 和 Manus 的核心差異,後兩者均無法自託管。你用便利性交換控制權和數據隱私。
Devin 與 OpenHands 的 SWE-bench 分數是多少?
OpenHands 搭配 Claude(CodeAct)的 SWE-bench Verified 分數約為 72%。Devin 2.x 的 SWE-bench Verified 分數約為 45–50%。注意:Devin 著名的 13.86% 分數是舊的 2024 發布數據,並非當前數據。Cognition 優先考慮現實世界可用性而非基準測試優化,所以請始終檢查 swebench.com 以獲取即時數據。
Devin 值得每月 500 美元嗎?
對於委派整個工程任務並擁有無限併發會話的團隊來說,是的。每月 500 美元的 Team 方案捆綁了 250 個 ACU,並允許多個代理並行運行。對於偶爾或單獨使用來說,這是大材小用。Core(每月 20 美元)或自託管的 OpenHands 對於輕量工作負載來說成本要低得多。
Manus 會做類似 SWE-bench 的儲存庫手術嗎?
不會。Manus 是一款在 GAIA 上進行基準測試的全能型應用程式建構器,而非 SWE-bench。它更擅長規劃、瀏覽和端到端建構完整應用程式,而非在現有代碼庫中進行手術式錯誤修復。對於儲存庫手術,OpenHands 或 Devin 才是正確形狀的工具。
OpenHands 和 OpenDevin 是一樣的嗎?
是的。OpenDevin 於 2024 年底在 All Hands AI 旗下重新品牌化為 OpenHands。相同的項目,相同的血統,新的名稱。如果你找到參考 OpenDevin 的舊教程,它們適用於 OpenHands,儘管自重新命名以來 CLI 和配置已經演變。
Claude Code、Cursor 或 Aider 呢?
這些都是優秀的代理,但它們屬於與這三方比較不同的賽道。Claude Code 和 Aider 更像是內嵌/助手形狀,而 Cursor 是一個編輯器。若要查看包含所有這些排名的完整名單,請參閱 完整的 12 款代理排名。
獨立開發者應該選哪一個?
通常是 OpenHands(自託管免費)或 Manus 或 Devin 的免費/低階層級。如果你的工作是儲存庫手術和錯誤修復,OpenHands 為你提供 0 美元加上推理费用的最佳準確率。如果你正在端到端建構應用程式,Manus 的免費層級更合適。將工具與你的任務形狀相匹配。
底線
在 OpenHands、Devin 和 Manus 之間沒有通用的贏家。正確的自主編碼 AI 代理是那個符合你最大單一限制條件的工具。
- OpenHands: 為控制權而選。開源、自託管、BYOM,開源領域頂尖的 SWE-bench(搭配 Claude 約 72%)。
- Devin: 為委派而選。一站式、基於 ACU(每月 20 至 500 美元),最放手型的自主性。
- Manus: 為完整應用程式建構而選。基於點數的全能型,GAIA 基準測試,現為 Meta 資產(需考量路線圖不確定性)。
- 始終 在帶有審查閘門的分支上運行代理,絕不直接推送到 main。
仍然不確定哪個適合你團隊的堆疊和風險承受能力?獲取免費諮詢,我們將幫助你選擇。