see-all  

返回   see-all > 生活休閒娛樂 > 主版面
論壇幫助 社區 日曆事件 今日新文章 搜尋

回覆
 
主題工具 顯示模式
舊 昨天, 09:33 AM   #1
chin5984
論壇管理員
 
chin5984 的頭像
 
註冊日期: 2007-11-12
文章: 2,764
預設 opencode go 模型分析

xAI — Grok 4.5
推測約 1.5 兆參數(官方沒正式公布),上下文視窗 500K token(比前一代 4.3 的 1M 縮小了,但速度換來效率)。強項是「便宜又省 token」——完成同樣任務平均比 Claude Opus 4.8 少產生約 4 倍的輸出 token,定價只要 $2/$6(每百萬 token 輸入/輸出),SWE-bench Pro 拿到 64.7%。適合大量、長時間跑的 agent 型任務,重視成本效益勝過絕對頂尖表現;缺點是這代拿掉了原生影片輸入,綜合分數落後 GPT-5.6 Sol、Opus 4.8。

OpenAI — GPT-5.6 Luna
GPT-5.6 系列分 Sol(旗艦)、Terra(中階)、Luna(效率款)三層,Luna 是最快、最便宜的一層,定位是「用約 1/3 時間、一半 token、四分之一成本,表現卻能超過 Opus 4.8」。定價 $1/$6,在 Agents' Last Exam 拿 50.3%、Coding Agent Index 74.6,雖然比 Sol(52.7%、80)略遜,但考慮到價格差距,CP 值非常高,適合日常、量大的任務。

Zhipu / Z.ai — GLM-5.2、GLM-5.1
兩者參數量幾乎一樣(約 753~754B),差異主要在上下文視窗跟訓練資料新舊:GLM-5.1 只有 200K 上下文,GLM-5.2 一口氣拉到 1M,輸出上限也從 128K 增加到 131K。跑分上 5.2 全面壓過 5.1(例如 AIME 2026 從 95.3% 提升到 99.2%),而且價格還更便宜($0.95/$3 vs $1.40/$4.40)。GLM-5.2 的招牌強項是處理「大型、雜亂的真實 repo」(SWE-bench Pro 62.1%,同代最高),適合改動既有大型專案;GLM-5.1 基本上已經算舊款,除非有特殊相容性需求,不然沒有理由選它。

Moonshot AI — Kimi K3、Kimi K2.7 Code、Kimi K2.6
K3 是目前 Kimi 系列的旗艦,2.8 兆參數的稀疏 MoE(比 K2.6 大約 2.8 倍),上下文拉到 1M(K2 系列是 256K),用了 Kimi Delta Attention 等技術處理超長序列,輸出 token 比 K2.6 省約 21%。在 Artificial Analysis 排行第三(僅次於 Claude Fable 5、GPT-5.6 Sol),尤其擅長「長時間、多步驟的知識工作」跟試算表類任務。K2.7 Code 是程式碼強化版,工具呼叫可靠度目前同代最強(MCP Atlas 76.0、MCP Mark Verified 81.1),適合需要模型自己判斷下一步、大量呼叫工具的自動化調查/開發場景。K2.6 則是上一代基礎款,主打長時間 agent 協作(13 小時 session、300 個子 agent 協同),仍然堪用但已被 K3、K2.7 超越。

Xiaomi — MiMo-V2.5、MiMo-V2.5-Pro
1 兆參數 MoE、每次推理只啟用約 420 億參數,1M 上下文,原生支援文字、圖片、音訊、影片多模態。Pro 版在 SWE-bench Pro 拿 57.2%,超過 Claude Opus 4.6(53.4%),特色是「harness awareness」——很懂得管理自己的上下文,能撐超過 1000 次連續工具呼叫還不亂。token 效率極高,比 Opus 4.6 省 40-60% token,價格也便宜(Pro 版 $1/$3,輸出成本只有 Claude 的八分之一)。適合大量跑、長時間自主的 agent pipeline,但官方不建議拿來做細膩的創意寫作或高合規要求的場景。

MiniMax — MiniMax M3、MiniMax M2.7
M3 是 428B MoE(啟用約 230 億),用了新的 MiniMax Sparse Attention,讓百萬 token 上下文的解碼速度提升 15.6 倍、prefill 快 9.7 倍,上下文從 M2.7 的 200K 一口氣跳到 1M。SWE-bench Pro 從 M2.7 的約 45% 大幅跳到 59.0%,超過 GPT-5.5。M3 最大特色是「同級唯一原生支援讀圖讀影片」的開源模型,很適合 UI 自動化、截圖轉程式碼、桌面 agent 這類需要「看畫面」的任務。價格是 M2.7 的兩倍($0.60/$2.40),但能力提升幅度更大,即將開源權重釋出。M2.7 則是純文字的上一代,除非預算極度敏感,不然已經被 M3 全面取代。

Alibaba — Qwen3.7 Max、Qwen3.7 Plus、Qwen3.6 Plus
3.7 Max 跟 3.7 Plus 都是 1M 上下文、支援長達 35 小時的自主 agent 任務(曾經連續跑 35 小時做核心優化、超過 1000 次工具呼叫,還持續找到效能改善)。兩者差異主要在能力與價格:Max 純文字分數略高(SWE-bench Pro 60.6% vs Plus 約 60%),但 Plus 便宜約 6 倍($0.40/$1.60 vs $2.50/$7.50),而且 Plus 額外支援視覺(讀圖),適合需要截圖除錯、文件理解、又要控制成本的團隊——大部分情況其實 Plus 的 CP 值更好,除非你就是要衝跑分或做純文字、低延遲的正式產線。Qwen3.6 Plus 是上一代,Terminal Bench 只有 61.6(3.7 Max 是 69.7),定位上已經是舊款,新專案沒有特別理由會選它。

DeepSeek — DeepSeek V4 Pro、DeepSeek V4 Flash
V4 Pro 原生 1M 上下文(最高輸出可到 38.4 萬 token),而且「基礎定價就內含 1M 上下文,不加價」,SWE-bench Verified 拿到 80.6~83.7%(業界前段班),LiveCodeBench 更高達 93.5%,特色是在範圍明確、要求精準的任務上表現特別穩,不容易腦補亂改。V4 Flash 是輕量版,輸出成本壓到約 $0.28/M token,適合大量、重複性高、每次任務不難的批次工作,例如大規模掃描或例行分析。

Tencent — Hy3
295B MoE 但每次推理只啟用約 210 億參數(192 個專家、top-8 路由,啟用比例僅約 4.2%),用很小的活躍參數量做到 SWE-bench Verified 74.4% 的成績,效率非常突出。上下文 256K,採 Apache 2.0 授權、無地區限制,可以自行下載權重私有部署,OpenRouter 上價格也很低(約 $0.14/M input)。已經在騰訊旗下 50 多個產品(微信、QQ 等)實際上線使用,適合重視資料主權(自架)、成本效益、又需要不錯程式碼能力的場景。

整體來看,如果你要的是「上下文越大越好、處理大量 log/文件」,DeepSeek V4 Pro、GLM-5.2、Qwen3.7 系列、MiniMax M3、Kimi K3 都給到 1M;如果要的是「agent 自己連續跑很久、大量呼叫工具還不斷鏈」,Kimi K2.7 Code、Qwen3.7 Max/Plus、MiMo-V2.5-Pro 是這批裡表現最突出的;如果最在意成本,DeepSeek V4 Flash、Hy3、Grok 4.5 是價格帶裡 CP 值較高的選擇。
chin5984 目前離線   回覆時引用此篇文章
舊 昨天, 09:34 AM   #2
chin5984
論壇管理員
 
chin5984 的頭像
 
註冊日期: 2007-11-12
文章: 2,764
預設

模型 特點
Grok 4.5 偏「coding + agent + knowledge work」;官方主打智慧型推理、工具使用和工程任務,適合做長流程任務。
GLM-5.2 Z.AI 的最新旗艦長程任務模型;重點是 1M 上下文、長流程執行、較強 coding 與多段工具協作。
GLM-5.1 比較像「長時間 автономous agent」取向;官方強調可單任務連續工作最長 8 小時,適合工程、除錯、長流程交付。
GPT 5.6 Luna OpenAI 的高性價比、低成本版本;偏高吞吐、低延遲,適合大量分類、摘要、路由、客服或批次任務。
Kimi K3 Kimi 的旗艦模型;長程 coding、知識工作、推理很強,原生視覺理解,1M 上下文,適合大專案和長文檔。
Kimi K2.7 Code 專門做 coding 的 agent 模型;比 K2.6 更強的長程編程與工具任務,且有高速版,適合 IDE / CLI 編程。
Kimi K2.6 比較均衡、回應快;支援文字/圖片/影片,思考與非思考都可切,適合日常問答、視覺理解、一般 agent。
MiMo-V2.5 小米的原生全模態模型;文字/圖片/影片/音訊都能吃,1M 上下文,偏多模態理解 + agent。
MiMo-V2.5-Pro 更偏複雜任務與 coding/agent;通常比普通版更強,適合長流程工程、複雜工具調用。
MiniMax M3 MiniMax 的旗艦前沿模型;主打 coding、agent、1M 上下文、原生多模態,還能做桌面操作。
MiniMax M2.7 偏實用型 agent / 工程模型;官方強調真實工程、辦公交付、角色扮演與長流程互動,並有高速度版。
Qwen3.7 Max Qwen3.7 系列最強;重點是最強推理、長週期自主執行、coding、工具調用、1M 上下文。
Qwen3.7 Plus 比 Max 更偏均衡;官方推薦它做聊天、摘要、文檔處理、程式工作,重點是性能/成本平衡。
Qwen3.6 Plus 視覺語言能力很強;適合 agentic coding、前端、Vibe coding、OCR、物體定位、圖片/影片理解。
DeepSeek V4 Pro 高能力版;偏強推理、強 agent coding、世界知識,適合更難的工程和長流程任務。
DeepSeek V4 Flash 更快、更省;推理接近 Pro,但延遲和成本更友好,適合高頻、簡單 agent 或量大任務。
Hy3 Tencent Hunyuan 的 MoE 模型;偏快慢思考結合,強調 agent、編程、辦公、生產力,且 256K 上下文。
chin5984 目前離線   回覆時引用此篇文章
回覆

書籤


發文規則
不可以發表新主題
不可以發表回覆
不可以上傳附件
不可以編輯自己的文章

啟用 BB 代碼
論壇啟用 表情符號
論壇啟用 [IMG] 代碼
論壇禁用 HTML 代碼

論壇跳轉


所有時間均為台北時間。現在的時間是 05:02 AM


Powered by vBulletin® 版本 3.8.2
版權所有 ©2000 - 2026,Jelsoft Enterprises Ltd.