本页为开发场景 OCR Benchmark v5 完整说明;榜单数据可在榜单查询 中交互查看(筛选、排序、搜索)。

开发场景 OCR Benchmark v5

更新时间:2026-07-15

开发场景 OCR 不只关心字符编辑距离。代码、配置、终端、错误日志和 IDE 截图更重视符号、缩进、阅读顺序、结构格式、噪声控制,以及输出能否直接复制、搜索和理解。

Benchmark 名称保持 v5,当前内容版本为 5.2。固定测试集包含 304 题,使用 P01-P09 主类别与 simple / medium / hard 难度双轴诊断。v5.2 结果不能与 v4 或更早内容版本直接混排。

数据集

当前活动数据集为 code_ocr_eval_benchmark_v5_content_5_2_photo30_20260710,入口为仓库根目录:

test.jsonl
test.json
测试集/

难度分布:

难度数量
simple63
medium156
hard85

类别分布:

主类别数量
P01 代码编辑器主体75
P02 终端与命令行35
P03 报错诊断与日志36
P04 配置与工程声明31
P05 版本控制与代码审阅20
P06 文档与网页代码块33
P07 API 参考与表格化结构24
P08 交互式开发工具视图20
P09 多区域混合开发屏30

流程

固定 304 题 v5.2 测试集 + 模型 OCR 预测文本
        |
dev_ocr_judge_v5_compat 六维 LLM 裁判
        |
样本分 -> P01-P09 类别加权
        |
基础稳定性、难度风险与可靠性扣分
        |
Benchmark v5 最终积分 + 类别/难度诊断

Benchmark v5 结果

最终排序使用 final_score_v5。全局均值和 NED 仅作诊断,不直接参与最终积分。LLM 裁判带来的总分展示误差按 ±0.5 计,小于 0.5 分的差距不视为显著差异。不同提示词策略不得混排。

短提示榜 <image>OCR:

方案记录最终积分原始积分类别加权全局均值最弱类别最弱难度严格可用率完成率安全分平均 NED报告备注
PaddleOCR-VL-1.6 本地微调版304/30458.4427 ±0.560.337472.863373.3494P09hard38.1579%99.0132%90.7895%0.1744report本地 vLLM;正式参数 max_tokens=4096repetition_penalty=1.08temperature=0
StepFun step-3.7-flash(high)304/30457.3628 ±0.562.336575.706175.5229P09hard50.3289%97.6974%79.2763%0.2481reportStepFun 官网 API;reasoning_effort=high
Qwen3.7 Plus (thinking)303/30442.3615 ±0.555.835274.895874.9389P03hard28.9474%99.6711%64.1447%0.4205report阿里百炼 API;API 默认 thinking;主批次 max_tokens=4096temperature=0;1 条默认参数补跑成功,另 1 条持续 504
DeepSeek V4 Flash Vision-Exp (thinking)304/30442.2189 ±0.552.8971.537471.7351P03hard32.5658%95.0658%71.7105%0.2502report官方;temperature=0max_tokens 不限;裁判为 deepseek-v4-flash 开思考
PaddleOCR-VL-1.6 官网 API303/30440.1408 ±0.544.055363.849162.3878P01hard25.6579%98.0263%80.2632%0.2660report官网异步 API;沿用旧版 1 条缺失记录
HyOCR 1.5 本地 vLLM304/30429.0668 ±0.539.533959.895660.6122P09hard28.9474%98.6842%57.8947%0.3813reporttemperature=0.0top_p=1.0top_k=-1repetition_penalty=1.08
Gemini 3.5 Flash (medium)304/3040.0000 ±0.56.739140.338639.1830P01medium1.3158%94.7368%12.8289%0.6807report中转站 OpenAI-compatible API;短提示
Kimi K2.6 (thinking)304/3040.0000 ±0.56.482838.780738.9743P03medium1.9737%94.7368%11.5132%0.7793report阿里百炼 API;API 默认 thinking;max_tokens=4096temperature=0

短提示榜结论:

官方推荐提示词榜

本组使用模型卡官方推荐提示词,不与 <image>OCR: 短提示榜直接排序。OvisOCR2 的提示词要求提取全部可读内容、按 Markdown 输出,并把表格转换为 HTML;这一目标与开发截图的主区域忠实转写存在口径差异。

方案记录最终积分原始积分类别加权全局均值最弱类别最弱难度严格可用率完成率安全分平均 NED报告备注
OvisOCR2 本地 vLLM304/30449.1981 ±0.553.349468.445467.9593P09hard29.2763%96.0526%79.6053%0.2414report官方模型卡提示词;temperature=0.0;本地 vLLM 0.21.0

本组结论:

类别诊断(短提示)

类别最佳方案类别分
P01 代码编辑器主体Qwen3.7 Plus (thinking)73.0144
P02 终端与命令行StepFun step-3.7-flash(high)84.3840
P03 报错诊断与日志StepFun step-3.7-flash(high)75.3920
P04 配置与工程声明Qwen3.7 Plus (thinking)84.7752
P05 版本控制与代码审阅StepFun step-3.7-flash(high)74.8332
P06 文档与网页代码块StepFun step-3.7-flash(high)90.0255
P07 API 参考与表格化结构StepFun step-3.7-flash(high)81.0332
P08 交互式开发工具视图Qwen3.7 Plus (thinking)85.7786
P09 多区域混合开发屏Qwen3.7 Plus (thinking)70.5303

难度诊断(短提示)

难度最佳方案难度分severe
simpleStepFun step-3.7-flash(high)80.314214.2857%
mediumStepFun step-3.7-flash(high)77.304121.1538%
hardQwen3.7 Plus (thinking)71.630436.4706%

LLM 六维评分

裁判模型为 tencent/hy3:free,prompt 版本为 dev_ocr_judge_v5_compat_hy3_reasoning_none。裁判只比较人工真值与模型输出,不把 NED 传入 prompt。DeepSeek V4 Flash Vision-Exp (thinking) 一行为口径例外:该行使用 deepseek-v4-flash 裁判(开思考、max_tokens 不限、同一 prompt 版本),严格度高于 hy3 裁判,其积分仅作参考,不参与横向排序比较。

维度满分含义
content_coverage_0_1010主要内容覆盖
symbol_accuracy_0_1010字符、代码符号、大小写、数字、路径和标点准确性
indentation_alignment_0_1010缩进、嵌套层级、表格或列表对齐
structure_format_0_1010换行、代码块、列表、表格和区域结构
reading_region_order_0_1010阅读顺序、区域顺序和多文本块顺序
noise_and_usability_0_1010重复、幻觉、无关文本、解释性文字和实际可用性

积分规则

样本分:

sample_score = 100 * (
  0.18 * content_coverage^1.35
+ 0.24 * symbol_accuracy^1.35
+ 0.16 * indentation_alignment^1.35
+ 0.16 * structure_format^1.35
+ 0.10 * reading_region_order^1.35
+ 0.16 * noise_and_usability^1.35
)

P01-P09 类别权重依次为 15% / 8% / 15% / 12% / 10% / 8% / 12% / 8% / 12%。每个类别先求样本分均值,再进行类别加权。

最终公式:

raw_score_v5 =
  category_weighted_score_v5
- simple_penalty_v5
- medium_risk_penalty_v5
- hard_risk_penalty_v5

final_score_v5 = clamp(raw_score_v5 - reliability_penalty_v5, 0, 100)

simple 基础题只扣分不加分;medium 和 hard 按 severe 比例扣分。可靠性扣分综合 severe、缺失、代码改写及幻觉/解释比例,上限为 15 分。完整公式见 文档/评测/benchmark_guide_v5.md

Severe Badcase

以下情况计入 severe:

missing_record
or noise_and_usability_0_10 <= 1
or content_coverage_0_10 <= 2
or symbol_accuracy_0_10 <= 2
or structure_format_0_10 <= 2
or error_tags contains code_added_removed_or_rewritten
or error_tags contains hallucinated_text
or error_tags contains empty_or_too_short
or error_tags contains refusal_or_unrecognized
or error_tags contains repeated_output
or output_length > 3 * label_length and noise_and_usability_0_10 <= 4

任一主类别或难度切片的 severe 比例超过 35% 时,应在对应模型报告中标记该切片不稳定。标签由 StepFun step-3.7-flash 每请求 5 张图片生成,仅用于视觉切片,不参与积分。