02 · 工作榜單

程式設計與除錯

實作、缺陷分析、測試與技術取捨。

官方版本
3
公開資料
2
資料截止日:
為什麼選擇這些候選
以公開的客觀工作資料作為起點,同時加入一個程式設計專用官方版本進行實測。
仍需驗證的部分
客觀工作榜單並非程式設計專項;程式碼庫脈絡與工具權限會改變結果。
公開資料
客觀工作
資料截止日
起始候選

三個值得優先測試的官方版本

公開資料可以縮小範圍,但不能取代真實工作中的受控測試。

3 / 3
起始候選 1

GPT-5.6 Sol

穩定版
gpt-5.6-sol

OpenAI客觀工作 · #1

模型官網
起始候選 2

Claude Opus 4.8

穩定版
claude-opus-4-8

Anthropic客觀工作 · #5

模型官網
起始候選 3

Qwen3 Coder Plus

穩定版
qwen3-coder-plus-2025-09-23

Alibaba Qwen目前沒有對應到這個具體版本的可比較公開結果。

模型官網
公開資料不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

GPT-5.6 Sol

資料來源
LiveBench
來源排名
#1
來源原始值
82.4
對應核實日期

Claude Opus 4.8

資料來源
LiveBench
來源排名
#5
來源原始值
78.9
對應核實日期

Qwen3 Coder Plus

目前沒有對應到這個具體版本的可比較公開結果。

這是實測起點,不是萬用冠軍選擇兩個或三個候選,查看並列的公開資料。

不同公開資料使用不同量尺。缺漏資料不會按 0 計算,不同來源也不會合併成一個分數。

客觀工作榜單並非程式設計專項;程式碼庫脈絡與工具權限會改變結果。

系統會預選這項工作範本與前兩個已選候選;收集回答前可編輯全部工作。