Unlimited OCR:让模型像人抄书一样,一口气读完整本书
百度用 R-SWA 把 DeepSeek-OCR 的 KV cache 摁成常数,单次前向解析几十页;OmniDocBench v1.5 拿 93%(6000 token 时比 baseline 快 35%)。
聚焦 AI 前沿技术,用程序员的视角解读最新论文和行业动态。
深度解析、代码实践、一手体验。
百度用 R-SWA 把 DeepSeek-OCR 的 KV cache 摁成常数,单次前向解析几十页;OmniDocBench v1.5 拿 93%(6000 token 时比 baseline 快 35%)。
Claude Code 51万行源码泄露始末——一场意外、一次 clean-room 重写、和一个一天10万星的 GitHub 传奇。
忠南大学提出LED基准:8种结构错误定义+合成数据集+三级评测任务。Gemini 2.5 Pro全面领先,GPT-4o粗粒度强但细粒度弱。
港科大广州等团队提出PhysBrain,通过Egocentric2Embodiment翻译管线将人类第一视角视频转化为300万条结构化监督信号,Planning超越GPT-4,SimplerEnv成功率53.9%。
程序员谈天(Coder Says)是一个专注 AI 技术深度解读的内容频道。
我们关注多模态、OCR、文档智能、大语言模型等前沿方向,用通俗的语言拆解最新论文,辅以代码实践和视频讲解。
📮 微信公众号:coder_says
💼 广告合作 / 工作机会:zwcihcn@gmail.com
💬 欢迎关注、交流、投稿
👆 扫码关注公众号