Qianfan-OCR:百度4B参数端到端模型,统一文档OCR与理解

深度解读 OCR 端到端 百度千帆

论文:arXiv:2603.13398 · 2026年3月 · 百度 AI Cloud
一句话:4B参数,OmniDocBench v1.5 端到端第一(93.12),KIE超越Gemini-3.1-Pro和Qwen3-VL-235B
Qianfan-OCR 概念图:AI大脑扫描文档并输出结构化内容
AI 生成配图:数字大脑扫描文档,输出带有版面标注的结构化内容

📌 30秒看懂

Qianfan-OCR 是百度推出的 4B 参数端到端文档智能模型,把传统 OCR 流水线(版面检测 → 文字识别 → 语言理解)压缩成一个模型。核心创新是 Layout-as-Thought——用 <think> token 触发可选的版面推理阶段,让端到端模型也能输出 bounding box 和版面结构。在 OmniDocBench v1.5 上拿到 93.12 分(端到端模型第一),关键信息提取超越 Gemini-3.1-Pro 和 Qwen3-VL-235B。

一、OCR的三角困境

当前 OCR 系统面临一个三方矛盾:成本、精度、能力不可兼得

工业界的文档处理通常是:检测模型 → OCR 模型 → 单独的 LLM 做理解。这种碎片化架构成本高、难优化、组件间信息丢失严重。Qianfan-OCR 用一个 4B 模型搞定全部

二、模型架构

Qianfan-OCR 架构对比:传统两阶段 Pipeline vs 端到端
图1(论文原图):传统两阶段 Pipeline(上)vs Qianfan-OCR 端到端架构(下)

Qianfan-OCR 继承自 Qianfan-VL 的多模态桥接架构,三大组件:

🏗️ 架构三件套

① Qianfan-ViT(视觉编码器):24层 Transformer,AnyResolution 设计动态切 448×448 tile,最多16块,支持 4K 输入。每个 tile 生成 256 个 visual token,单页最多 4096 个 token——这对文档中的小字、密排至关重要。

② MLP Adapter(跨模态桥):两层 MLP + GELU,把 1024 维视觉特征投射到 2560 维语言空间。简单但够用。

③ Qwen3-4B(语言骨干):36层,GQA(32 query heads / 8 KV heads),KV cache 减少 4×,32K 上下文窗口。够强(复杂推理)又够小(单 GPU 部署)。

三、核心创新:Layout-as-Thought

端到端 OCR 最大的痛点:丢失了显式版面分析。Pipeline 系统天然有检测模块输出 bounding box,但端到端模型直接输出文本,没有中间结构。

Layout-as-Thought 概念图:可选的版面推理阶段
AI 生成配图:Layout-as-Thought 的核心理念——先"思考"版面结构,再生成内容

Layout-as-Thought 的工作方式:

  1. 用户在 prompt 后加 <think> token 触发
  2. 模型进入思考阶段:生成每个元素的 bounding box、类型标签(25类)、阅读顺序
  3. 基于这个结构化推理,生成最终 OCR 输出

💡 精妙之处:可选,不是强制

📄 简单文档(纯文本、单栏)→ 不开 think,直接输出,更快更好
📊 复杂文档(多栏、混排公式/表格/图片)→ 开 think,版面推理帮助解析

Think vs No-Think 对比曲线
图2(论文原图):按版面复杂度排序,高复杂度文档开 think 更好(蓝线在左侧更高),简单文档不开更好

实验验证了这一直觉:按版面标签熵排序,高熵(复杂)文档用 think 提升明显,低熵(简单)文档不用 think 反而更好。这意味着用户可以根据文档类型智能选择。

🔢 坐标 Token 的效率优化

所有坐标用 <COORD_0><COORD_999> 的专用 token 表示,一个坐标只占一个 token(而不是 "779" 需要 3 个 token)。Think 输出长度减少约 50%,推理延迟显著降低。一个复杂页面可能有 60+ 个版面元素,这个优化非常关键。

四、训练方法:4阶段渐进训练

阶段Token 量训练内容可训练模块
Stage 1 跨模态对齐50B图文配对 + 简单 OCR仅 Adapter
Stage 2 基础 OCR2T文档 45% + 场景 25% + 描述 15% + 专项 15%全参数
Stage 3 领域增强800B复杂表格 22% + 公式 20% + 图表 18% + KIE 18% + 多语言 12% + 文档理解 10%全参数
Stage 4 指令微调百万级样本全场景指令调优 + 推理增强全参数

总训练量 2.85T tokens,在 1024 块百度昆仑 P800 芯片上完成,全流程一周以内。

⚡ Ablation 关键发现

6大数据合成流水线

Qianfan-OCR 的训练数据来自 6 条专门构建的数据流水线:

五、实验结果

OmniDocBench v1.5 — 端到端第一 🏆

OmniDocBench v1.5 对比柱状图
图3(论文原图):OmniDocBench v1.5 Pipeline(左)vs 端到端(右)模型对比。Qianfan-OCR(红色)93.12,端到端第一
模型类型Overall ↑Text Edit ↓Formula CDM ↑Table TEDS ↑
🏆 Qianfan-OCRE2E93.120.04192.4391.02
DeepSeek-OCR-v2E2E91.090.04890.3187.75
Gemini-3 ProE2E90.330.06589.1888.28
Qwen3-VL-235BE2E89.150.06988.1486.21
Gemini-2.5 ProE2E88.030.07585.8285.71
PaddleOCR-VL 1.5Pipeline94.500.03594.2192.76

4B 参数 → 超过 DeepSeek-OCR-v2、Gemini-3 Pro、Qwen3-VL-235B。跟顶级 Pipeline(PaddleOCR-VL 1.5)的差距只有 1.38 分

文档理解 — 图表任务碾压级优势

BenchmarkQianfan-OCR (4B)Qwen3-VL-4B最佳 Pipeline+LLM
CharXiv_DQ(学术图表问答)94.081.80.0 💀
CharXiv_RQ(学术图表推理)85.248.50.0 💀
ChartQA88.183.356.8
ChartBench85.974.917.2
DocVQA92.894.967.1
ChartQAPro42.936.220.9

🔥 最震撼的结果

所有两阶段 OCR+LLM 系统在 CharXiv 上得分 0.0。因为图表的结构、坐标轴关系、数据点位置在 OCR 文字提取阶段就丢了——这些信息对回答问题至关重要。这直接证明了端到端架构保留视觉上下文的价值

关键信息提取 — 4B 打赢 235B

模型参数量Overall Mean中文 KIE
🏆 Qianfan-OCR4B87.982.3
Qwen3-VL-235B235B84.262.9
Qwen3-VL-4B4B83.571.3
Gemini-3.1-Pro?79.263.4
Seed-2.0?78.048.9

4B 模型打赢 235B 模型(超 3.7 分),打赢 Gemini-3.1-Pro(超 8.7 分)。中文 KIE 尤其突出:82.3 vs Qwen3-235B 的 62.9,差距近 20 分。

通用 OCR — OCRBench 第一

模型OCRBenchOCRBenchv2 (en/zh)CCOCR 多语言
Qianfan-OCR88056.0 / 60.7776.7
Qwen3-VL-4B87360.68 / 59.1374.2
PaddleOCR-VL54918.15 / 40.8645.5

六、对行业的启示

🤔 行业视角

Qianfan-OCR 的设计决策对整个文档智能行业都有启发:

七、局限性与展望

八、总结

🎯 要点回顾

  1. 统一架构:一个 4B 模型 = 版面检测 + OCR + 文档理解 + KIE,消除 Pipeline 的误差传播
  2. Layout-as-Thought:可选的版面推理阶段,复杂文档开启、简单文档跳过,兼顾精度和效率
  3. SOTA 端到端:OmniDocBench v1.5 得分 93.12(端到端第一),KIE 超越 Gemini 和 235B 级模型
  4. 图表理解:端到端 vs Pipeline 的最大优势场景——Pipeline 在 CharXiv 上得分 0
  5. 4 阶段训练:通用预训练不可跳过,领域增强需要混合通用数据作正则化

论文链接:arXiv:2603.13398  |  GitHub:github.com/baidubce/Qianfan-VL