💻

程序员谈天

Coder Says

聚焦 AI 前沿技术,用程序员的视角解读最新论文和行业动态。
深度解析、代码实践、一手体验。

🔬 AI 论文解读 🧠 多模态 & OCR 🛠️ 工程实践 📺 视频讲解
📝 最新文章

Unlimited OCR:让模型像人抄书一样,一口气读完整本书

百度用 R-SWA 把 DeepSeek-OCR 的 KV cache 摁成常数,单次前向解析几十页;OmniDocBench v1.5 拿 93%(6000 token 时比 baseline 快 35%)。

凌晨4点,Anthropic的"潘多拉魔盒"被打开了

Claude Code 51万行源码泄露始末——一场意外、一次 clean-room 重写、和一个一天10万星的 GitHub 传奇。

LED: 文档版面分析的"体检报告"来了——八类结构错误,你的模型能发现几个?

忠南大学提出LED基准:8种结构错误定义+合成数据集+三级评测任务。Gemini 2.5 Pro全面领先,GPT-4o粗粒度强但细粒度弱。

PhysBrain:用人类第一人称视频教会机器人"物理智能"

港科大广州等团队提出PhysBrain,通过Egocentric2Embodiment翻译管线将人类第一视角视频转化为300万条结构化监督信号,Planning超越GPT-4,SimplerEnv成功率53.9%。

Qianfan-OCR:百度4B参数端到端模型,统一文档OCR与理解
百度千帆4B参数端到端文档智能模型,Layout-as-Thought可选版面推理,OmniDocBench v1.5端到端第一(93.12),KIE超越Gemini-3.1-Pro和Qwen3-VL-235B。
不改模型,只改数据:用合成数据让文档版式分析提升2-4%
形式化合成数据生成框架,中位数分割+随机采样策略,YOLO11m全指标提升2-4%,已集成到MinerU。数据工程 > 模型工程。
GLM-OCR:9亿参数小模型,如何登顶文档理解之巅?
智谱AI × 清华:0.9B参数,OmniDocBench v1.5 第一名(94.62),超越 Gemini-3 Pro 和 Qwen3-VL-235B。CogViT + GLM + MTP 多Token预测,吞吐提升50%。
给YOLO动三刀,文档版面分析快又准?常州团队的SL-YOLO,我们来扒一扒
YOLOv8s上三个改进:星形梯度重构、大核注意力、动态聚焦损失。CDLA提升3.6%,计算量降38%。
小红书搞了个“万物皆可OCR”:3B小模型干翻一众大模型
小红书hi lab联合华中科大白翔团队提出 MOCR,仅3B参数,统一图文解析为SVG,olmOCR-Bench SOTA 83.9分。
OCR已死?别急着下结论——深度解读+批判性分析
多模态大模型直接看图做文档信息抽取,能打平传统 OCR+LLM pipeline?结论很大胆,但事情没那么简单。
21款PDF表格解析器大比拼:LLM当裁判,谁才是真正的王者?
从 PyMuPDF 到 GPT-4o,21个解析器横评,LLM打分。最贵的不一定最好,开源方案也有惊喜。
📺 视频讲解
LED:文档版面分析的"体检报告"——八类结构错误评测基准
约4分钟 · 中文讲解 · 8种错误类型+三级评测
PhysBrain:用人类第一人称视频教会机器人"物理智能"
约5分钟 · 中文讲解 · Egocentric2Embodiment详解
Qianfan-OCR:百度4B参数端到端文档智能模型
约5分钟 · 中文讲解 · Layout-as-Thought详解
不改模型,只改数据:合成数据让DLA提升2-4%
约3分30秒 · 中文讲解 · 已集成MinerU
GLM-OCR:9亿参数如何登顶文档理解之巅?
约6分钟 · 中文讲解 · 图文并茂
SL-YOLO:给YOLO动三刀做文档版面分析
约2分30秒 · 中文讲解
MOCR 论文讲解:小红书3B模型如何统一OCR
约3分40秒 · 中文讲解 · 带字幕
OCR已死?——论文深度解读与批判性分析
中文讲解 · 带字幕
21款PDF解析器横评:谁才是王者?
中文讲解 · 带字幕
👋 关于

程序员谈天(Coder Says)是一个专注 AI 技术深度解读的内容频道。

我们关注多模态、OCR、文档智能、大语言模型等前沿方向,用通俗的语言拆解最新论文,辅以代码实践和视频讲解。

📮 微信公众号:coder_says
💼 广告合作 / 工作机会:zwcihcn@gmail.com
💬 欢迎关注、交流、投稿

程序员谈天 公众号二维码

👆 扫码关注公众号