see-all  

返回   see-all > 生活休閒娛樂 > 主版面

 
 
主題工具 顯示模式
舊 昨天, 09:33 AM   #1
chin5984
論壇管理員
 
chin5984 的頭像
 
註冊日期: 2007-11-12
文章: 2,764
預設 opencode go 模型分析

xAI — Grok 4.5
推測約 1.5 兆參數(官方沒正式公布),上下文視窗 500K token(比前一代 4.3 的 1M 縮小了,但速度換來效率)。強項是「便宜又省 token」——完成同樣任務平均比 Claude Opus 4.8 少產生約 4 倍的輸出 token,定價只要 $2/$6(每百萬 token 輸入/輸出),SWE-bench Pro 拿到 64.7%。適合大量、長時間跑的 agent 型任務,重視成本效益勝過絕對頂尖表現;缺點是這代拿掉了原生影片輸入,綜合分數落後 GPT-5.6 Sol、Opus 4.8。

OpenAI — GPT-5.6 Luna
GPT-5.6 系列分 Sol(旗艦)、Terra(中階)、Luna(效率款)三層,Luna 是最快、最便宜的一層,定位是「用約 1/3 時間、一半 token、四分之一成本,表現卻能超過 Opus 4.8」。定價 $1/$6,在 Agents' Last Exam 拿 50.3%、Coding Agent Index 74.6,雖然比 Sol(52.7%、80)略遜,但考慮到價格差距,CP 值非常高,適合日常、量大的任務。

Zhipu / Z.ai — GLM-5.2、GLM-5.1
兩者參數量幾乎一樣(約 753~754B),差異主要在上下文視窗跟訓練資料新舊:GLM-5.1 只有 200K 上下文,GLM-5.2 一口氣拉到 1M,輸出上限也從 128K 增加到 131K。跑分上 5.2 全面壓過 5.1(例如 AIME 2026 從 95.3% 提升到 99.2%),而且價格還更便宜($0.95/$3 vs $1.40/$4.40)。GLM-5.2 的招牌強項是處理「大型、雜亂的真實 repo」(SWE-bench Pro 62.1%,同代最高),適合改動既有大型專案;GLM-5.1 基本上已經算舊款,除非有特殊相容性需求,不然沒有理由選它。

Moonshot AI — Kimi K3、Kimi K2.7 Code、Kimi K2.6
K3 是目前 Kimi 系列的旗艦,2.8 兆參數的稀疏 MoE(比 K2.6 大約 2.8 倍),上下文拉到 1M(K2 系列是 256K),用了 Kimi Delta Attention 等技術處理超長序列,輸出 token 比 K2.6 省約 21%。在 Artificial Analysis 排行第三(僅次於 Claude Fable 5、GPT-5.6 Sol),尤其擅長「長時間、多步驟的知識工作」跟試算表類任務。K2.7 Code 是程式碼強化版,工具呼叫可靠度目前同代最強(MCP Atlas 76.0、MCP Mark Verified 81.1),適合需要模型自己判斷下一步、大量呼叫工具的自動化調查/開發場景。K2.6 則是上一代基礎款,主打長時間 agent 協作(13 小時 session、300 個子 agent 協同),仍然堪用但已被 K3、K2.7 超越。

Xiaomi — MiMo-V2.5、MiMo-V2.5-Pro
1 兆參數 MoE、每次推理只啟用約 420 億參數,1M 上下文,原生支援文字、圖片、音訊、影片多模態。Pro 版在 SWE-bench Pro 拿 57.2%,超過 Claude Opus 4.6(53.4%),特色是「harness awareness」——很懂得管理自己的上下文,能撐超過 1000 次連續工具呼叫還不亂。token 效率極高,比 Opus 4.6 省 40-60% token,價格也便宜(Pro 版 $1/$3,輸出成本只有 Claude 的八分之一)。適合大量跑、長時間自主的 agent pipeline,但官方不建議拿來做細膩的創意寫作或高合規要求的場景。

MiniMax — MiniMax M3、MiniMax M2.7
M3 是 428B MoE(啟用約 230 億),用了新的 MiniMax Sparse Attention,讓百萬 token 上下文的解碼速度提升 15.6 倍、prefill 快 9.7 倍,上下文從 M2.7 的 200K 一口氣跳到 1M。SWE-bench Pro 從 M2.7 的約 45% 大幅跳到 59.0%,超過 GPT-5.5。M3 最大特色是「同級唯一原生支援讀圖讀影片」的開源模型,很適合 UI 自動化、截圖轉程式碼、桌面 agent 這類需要「看畫面」的任務。價格是 M2.7 的兩倍($0.60/$2.40),但能力提升幅度更大,即將開源權重釋出。M2.7 則是純文字的上一代,除非預算極度敏感,不然已經被 M3 全面取代。

Alibaba — Qwen3.7 Max、Qwen3.7 Plus、Qwen3.6 Plus
3.7 Max 跟 3.7 Plus 都是 1M 上下文、支援長達 35 小時的自主 agent 任務(曾經連續跑 35 小時做核心優化、超過 1000 次工具呼叫,還持續找到效能改善)。兩者差異主要在能力與價格:Max 純文字分數略高(SWE-bench Pro 60.6% vs Plus 約 60%),但 Plus 便宜約 6 倍($0.40/$1.60 vs $2.50/$7.50),而且 Plus 額外支援視覺(讀圖),適合需要截圖除錯、文件理解、又要控制成本的團隊——大部分情況其實 Plus 的 CP 值更好,除非你就是要衝跑分或做純文字、低延遲的正式產線。Qwen3.6 Plus 是上一代,Terminal Bench 只有 61.6(3.7 Max 是 69.7),定位上已經是舊款,新專案沒有特別理由會選它。

DeepSeek — DeepSeek V4 Pro、DeepSeek V4 Flash
V4 Pro 原生 1M 上下文(最高輸出可到 38.4 萬 token),而且「基礎定價就內含 1M 上下文,不加價」,SWE-bench Verified 拿到 80.6~83.7%(業界前段班),LiveCodeBench 更高達 93.5%,特色是在範圍明確、要求精準的任務上表現特別穩,不容易腦補亂改。V4 Flash 是輕量版,輸出成本壓到約 $0.28/M token,適合大量、重複性高、每次任務不難的批次工作,例如大規模掃描或例行分析。

Tencent — Hy3
295B MoE 但每次推理只啟用約 210 億參數(192 個專家、top-8 路由,啟用比例僅約 4.2%),用很小的活躍參數量做到 SWE-bench Verified 74.4% 的成績,效率非常突出。上下文 256K,採 Apache 2.0 授權、無地區限制,可以自行下載權重私有部署,OpenRouter 上價格也很低(約 $0.14/M input)。已經在騰訊旗下 50 多個產品(微信、QQ 等)實際上線使用,適合重視資料主權(自架)、成本效益、又需要不錯程式碼能力的場景。

整體來看,如果你要的是「上下文越大越好、處理大量 log/文件」,DeepSeek V4 Pro、GLM-5.2、Qwen3.7 系列、MiniMax M3、Kimi K3 都給到 1M;如果要的是「agent 自己連續跑很久、大量呼叫工具還不斷鏈」,Kimi K2.7 Code、Qwen3.7 Max/Plus、MiMo-V2.5-Pro 是這批裡表現最突出的;如果最在意成本,DeepSeek V4 Flash、Hy3、Grok 4.5 是價格帶裡 CP 值較高的選擇。
chin5984 目前離線   回覆時引用此篇文章
 

書籤

主題工具
顯示模式

發文規則
不可以發表新主題
不可以發表回覆
不可以上傳附件
不可以編輯自己的文章

啟用 BB 代碼
論壇啟用 表情符號
論壇啟用 [IMG] 代碼
論壇禁用 HTML 代碼

論壇跳轉


所有時間均為台北時間。現在的時間是 06:50 AM


Powered by vBulletin® 版本 3.8.2
版權所有 ©2000 - 2026,Jelsoft Enterprises Ltd.