本页为 code_bench v1.4 完整题目与说明;榜单数据可在榜单查询 中交互查看(筛选、排序、搜索)。

code_bench v1.4

题目结构

题目满分内容
基础题 · core30复刻 C11 执行器 owc-exec(stdio JSON-RPC 2.0)
基础题 · server30复刻 Node 20+ 服务层(HTTP/WS API + agent 循环)
基础题 · web v230复刻 React 19 + Vite 前端 基于owc1.9.9版本提交
基础题 · 拼接(题目编写中)10三个子项拼成端到端系统,不限制拼接方法(A/B/C 档系数 1.0/0.8/0.5)
基础题·python30用python开发一个文件分享程序
高阶题 · full_v21003大+1小模块,开发一个coding agent
高阶题 · rust v3100一个rust后端加sqlite加静态前端(rust为绝对主要)

环境

debian13 x86-64 上使用 openwebcode


排行

模型
deepseek-v4.1-flash(max)
mimo-v2.6-pro(thinking)
kimi-k3(max)
kimi-k2.8-preview(max)
kimi-k3(high)
hy4-preview(high)
glm5.3(max)
qwen3.8-flash(max)
gpt-5.6-luna(max)
glm-5.3-flash(max)
step-5-preview(high)
gemini-3.7-flash(high)
...

历史模型

模型
deepseek-v4-pro0813(max)
deepseek-v4-flash0902(max)
deepseek-v4.1-flash-expires-on-0910(max)
deepseek-v4-flash-vision-exp(max)
glm-ox-alpha(max)
deepseek-v4-flash0731(max)

基础题

core

模型积分成本(折算API价格)token(不算缓存)缓存
kimi-k3(high)26.254.89元394k98.7%(16.485m)
deepseek-v4.1-flash-expires-on-0910(max)263.24-6.48元525k99.1%(36.854m)
deepseek-v4-pro0813(max)269.33-18.66元315k99.8%(37.834m)
deepseek-v4-flash0902(max)25.86.43-12.86元528k99.8%(90.021m)
glm5.3(max)25.682.19元455k99.3%(37.21m)
glm-5.3-flash(max)24.93.83元499k99.1%(29.582m)
deepseek-v4-flash-vision-exp(max)25.23.53-7.06元352k99.7%(46.685m)
deepseek-v4-flash0731(max)24.65.05-10.1元782k99.2%(57.256m)
glm-ox-alpha(max)24.20元628k99.2%(55.048m)
gemini-3.7-flash(high)23.7~12.15元1069k91%(9.57m)

server

模型积分成本(折算API价格)token(不算缓存)缓存
kimi-k3(high)27.214.63元138k97.8%(4.085m)
deepseek-v4.1-flash-expires-on-0910(max)25.8(稳定性不好)2.31-4.62元499k97.7%(20.219m)
glm5.3(max)25.1约30-40元?k?%(?m)
deepseek-v4-pro0813(max)25.84.75-9.5元221k99.5%(17.062m)
glm-5.3-flash(max)23.85.44元573k99.1%(43.651m)
deepseek-v4-flash0731(max)22.7/24.720.9-41.8元12563k72%(30.052m)
gemini-3.7-flash(high)-k%(m)
未测试k%(m)

web v2

模型积分成本(折算API价格)token(不算缓存)缓存接入方式备注
kimi-k3(high)--元-k-%(-m)kimi订阅
glm-5.3-flash(max)241.94元(限时5折)307k98.8%(14.674m)官方api
deepseek-v4.1-flash-expires-on-0910(max)244.22-8.44元339k99.8%(60.087m)官方api
qwen3.8-flash(max)23.64.25元735k98.5%(31.408m)官方api
glm5.3(max)23.432.14元310k98.7%(13.454m)官方订阅zcode预设
hy4-preview(high)23.412.28元636k97.8%(21.541m)官方API
deepseek-v4-flash-vision-exp(max)13.31.99元503k97.9%(15.849m)官方api
deepseek-v4-pro0813(max)--元-k-%(-m)官方api
未测试k%(m)官方

高阶题

full_v2

模型积分成本(折算API价格)订阅折算token(不算缓存)缓存接入方式备注
deepseek-v4.1-flash(max)73.541.765-3.53元354k99.7%(27.732m)官方api
mimo-v2.6-pro(thinking)67.12.63元2.13元495k98.6%(19.615m)官方api
deepseek-v4.1-flash-expires-on-0910(max)65.82.37-4.74元311k99.7%(23.698m)官方api
kimi-k3(max)62.9192.12元7.36元803k98.1%(29.29m)kimi订阅kimicode预设
kimi-k2.8-preview(max)61.940元(不确定了)3.2元636k98.8%(29.051m)kimi订阅kimicode预设
glm5.3(max)60.798.28元7.86元766k98.7%(44.189m)glm订阅zcode
step-5-preview(high)44.7543.74元1.094元3157k95.3%(58.102m)step订阅

rust v3

模型积分成本(折算API价格)订阅折算token(不算缓存)缓存接入方式备注
deepseek-v4.1-flash(max)61.661.67-3.34元683k97.7%(20.114m)官方api
mimo-v2.6-pro(thinking)61.361.8元1.458元367k97.7%(9.146m)官方api
qwen3.8-flash(max)54.74.98元1.243元1001k98%(36.75m)官方api
gpt-5.6-luna(max)50.964.19元-410k98.6%(19.426m)zenmux api
step-5-preview(high)42.6824.6元0.61元449k99.7%(55.503m)step订阅
glm5.3(max)--元-元-k-%(-m)官方apizcode预设
glm-5.3-flash(max)--元-元-k-%(-m)官方apizcode预设
hy4-preview(high)--元--k-%(-m)--
kimi-k2.8-preview(max)--元--k-%(-m)kimi订阅kimicode预设
kimi-k3(max)--元--k-%(-m)kimi订阅kimicode预设
kimi-k3(high)--元--k-%(-m)kimi订阅kimicode预设

分析

  1. K3在C部分相当高效,但在full_v2项目C之外的部分表现不佳,(high思考强度偏向于节省token精简架构,无论是c项目还是前端项目,都比其他的更简洁,c因为有编译器兜底,所以bug更少,web需要人工review,模型为了省token,导致部分bug没找出来)
  2. 单纯从颜值上来讲,我更喜欢k3的风格,美观程度为主观评判,未参与积分
  3. 实际体验来讲,glm5.3好于v4-pro0813,v4稳定性难评
  4. v4.1f-0910稳定性不如glm5.3好于v4p,但速度极快
  5. step5preview有些复古
  6. kimi-k2.8-preview细节不行,虽然不影响得分,但影响后续开发速度和体验
  7. ...

声明

  1. full_v2项目主要反映模型从0到1的理解用户需求,规划和开发能力
  2. 本bench由 github 用户 snnh 版权所有。
  3. 接受模型送测(只是为了多体验更多模型)
  4. 欢迎赞助token

致谢

  1. 感谢shyliuli和Karpy II提供的glm5.3评测环境