📝 全部文章
Claude Code 源码泄露:1900个文件、50万行代码的深度技术解剖
Anthropic的Claude Code CLI工具源码意外泄露,深入分析其架构设计、Agent循环、工具系统和安全机制。
GLM-OCR:9亿参数小模型,如何登顶文档理解之巅?
智谱AI × 清华:0.9B参数,OmniDocBench v1.5 第一名(94.62),超越 Gemini-3 Pro 和 Qwen3-VL-235B。CogViT + GLM + MTP 多Token预测,吞吐提升50%。
给YOLO动三刀,文档版面分析快又准?常州团队的SL-YOLO,我们来扒一扒
YOLOv8s上三个改进:星形梯度重构、大核注意力、动态聚焦损失。CDLA提升3.6%,计算量降38%。
小红书搞了个“万物皆可OCR”:3B小模型干翻一众大模型
小红书hi lab联合华中科大白翔团队提出 MOCR,仅3B参数,统一图文解析为SVG,olmOCR-Bench SOTA 83.9分。
OCR已死?别急着下结论——深度解读+批判性分析
多模态大模型直接看图做文档信息抽取,能打平传统 OCR+LLM pipeline?结论很大胆,但事情没那么简单。
21款PDF表格解析器大比拼:LLM当裁判,谁才是真正的王者?
从 PyMuPDF 到 GPT-4o,21个解析器横评,LLM打分。最贵的不一定最好,开源方案也有惊喜。