AI界开年就都在谈论智能体以及AI员工这个话题的时候,1月27日,DeepSeek静悄悄地发布了一项似乎“没意思”的更新,也就是DeepSeek - OCR2。
在日期为2025年10月20日时,DeepSeek - OCR1发布了,而此次是在其发布后时隔三个月出现的最新更新,虽然看上去好像并不像传说里的V4那样能让人满怀期待,然而DeepSeek - OCR2的公布,或许会犹如敲响丧钟一般,直接作用于拥有千亿级规模的OCR(也就是文档识别)市场吧。
在过去的十年当中,OCR始终都是一门处于隐秘状态且有着暴利性质的生意,从Adobe的PDF编辑器,到扫描全能王所收取的会员费用,再到亚马逊AWS Textract那价格昂贵的API调用,数不清的公司凭借着“教机器认字”这一行为获取到了极为丰厚的利润。
拿全能扫描王的母公司合合信息来说,其财报表明公司毛利率长久以来保持在85%的水准。然而一夜之间,DeepSeek告知市场:识别文字图片能够不需要这般昂贵。
从机械扫描到智能阅读
对于DeepSeek - OCR2而言,其核心创新之处在于,引入了一种名为DeepEncoder - V2的新型编码器结构,这种结构具备这样的能力,即能够依据图像语义,动态地调整视觉信息的处理顺序,最终实现让模型,在开展文字识别之前,先对视觉内容进行智能排序。
传统OCR如同一位“勤奋然而死板的抄写员”,它一般依照从左至右的顺序,接着按照从上到下的顺序,机械地对图片进行扫描。
这种模式存在死穴,那就是"不懂逻辑"。当碰到报纸的跨栏排版时,它会把两篇没有关联的文章拼接在一起。面对扭曲的发票,其找不到对齐线。对于密集的小字财报,所能看到的仅是模糊化的文本。
相较于DeepSeek这个,OCR2引入了名为“视觉因果流”的概念来,在DeepEncoder-V2里,研究团队把原先基于CLIP的视觉编码模块给替换成了一种类语言模型结构,并且在编码器内部引入了可学习的“因果流查询token”。
该编码器当中,同时涵盖双向注意力与因果注意力这两种处理模式,原始的视觉信息借助双向注意力来开展全局感知,然而新增的查询标记经由因果注意力逐步构建语义顺序。
这等同于给AI套上了“自适应显微镜”,它并非再去暴力压缩图片,而是依照内容密度来进行动态切片,哪里字多,就切得细一点去查看,哪里是空白,就直接跳过。
理解力的革命
测试结果于OmniDocBench v1.5基准上得以显示,且是在视觉token上限更低之情形下,DeepSeek - OCR2的整体得分达至91.09%,此与之相较DeepSeek - OCR提升了3.73%。尤其于阅读顺序准确度层面,编辑距离由0.085下降至0.057。
但性能提升只是表象,真正革命性的是其背后的理解能力。
DeepSeek - OCR2并非单纯直接常规地将图像转变转变成文字,而是会直接输出Markdown或者JSON格式状况。它所看到的并非是线条以及墨水的这种特征类型,而是“键值对”这种特定形式内容。
这表明企业原本所需的、雇佣工程师去编写大量正则表达式以开展清洗数据的那项工作,刹那间就丧失了价值。更为关键的是,它自身具备质量控制功能。要是你给它一张带有油渍的超市小票,油渍把“总价”给挡住了,传统OCR会实实在在地输出一堆杂乱无章的字符。DeepSeek会读取上面所有的单价以及数量,在“心里”进行一次加法运算,接着推断出:“尽管此处看不清楚,但依据计算逻辑,总价理应是108.5元”。
自带具有逻辑校验性质的这种能力,对于银行流水审核而言,是梦寐以求的“圣杯”,对于保险理赔录入来说,同样也是梦寐以求的“圣杯”。
与此同时,人类所拥有的商业文档之中饱含着潜台词:加粗这种情况意味着强调,呈现红色意味着处于亏损状态,带有箭头则意味着是流程。传统的OCR会将这些信息给丢掉,然而DeepSeek能够把这些“情绪和重点”留存下来。
能够成为未来的AI分析师,其首先要能够读懂财报之中所呈现的数字,其次要是能够读懂管理层借助排版方式去试图掩盖的坏消息。
200倍价差的降维打击
除了在性能方面有进化之外,DeepSeek又一次给到了OCR行业些许价格上的震撼。
依AWS官方定价,运用Textract的Analyze Document API来处理表格,于美国西部(俄勒冈)地区,前100万页时每页价格是0.015美元,超过100万页后每页价格为0.010美元。若使用Custom Queries功能,价格甚高,前100万页时每页达0.025美元,超过100万页后每页为0.015美元。采用Pretrained Forms跟Custom Queries的搭配,价钱为每页0.065美元(就在前100万页这个范围)。
这表明,针对具有复杂表格的1000页金融文档予以处理,要是运用AWS Textract的话,大概会需要65美元,这换算成人民币是470元。
对于DeepSeek的Token计费模型而言,在处理同样信息量的文档时,其成本大约是0.28美元,换算成人民币约为2元。要是命中缓存的话,成本会低至0.028美元。从65美元到0.28美元,这里存在着超过200倍之多的成本差距存在。
对于任何商业竞争而言,一旦挑战者的成本仅为你的二分之一百,那么原本被视作值得骄傲的“独家算法”,以及“私有数据集”,都会变得没有任何意义。
谁在颤抖,谁在狂欢
一个名为DeepSeek - OCR2的事物出现了,它直接致使,以合合信息、汉王科技、ABBYY作为代表的传统OCR厂商,其所秉持的“我们积累了十年的票据模板,大模型做不好这些长尾场景”这样的叙述逻辑,直接宣告崩塌。
然而,针对各类有着不同属性的OCR厂商来讲,DeepSeek给他们造成的冲击是明显能够看得出来的。
的C端产品主要为扫描全能王、名片全能王、启信宝等APP,合合信息,B端产品主要是向各行业客户供给智能文字识别、商业大数据的产品及服务。当DeepSeek证实了:大模型不但能做,并且无需专门训练便能做得更优。当是剩下脆弱的只客户关系,通用模型的泛化能力覆盖了垂直模型的专业能力,这些公司的技术壁垒便消失了。
就Adobe Acrobat而言,它身为PDF那个时代的王者,其内在逻辑是“编辑”。在AI时代,用户并非需要“编辑”PDF,他们所需要的是“重构”内容。要是DeepSeek能够直接读懂PDF,并且把它天衣无缝地转化成可编辑的Word,甚至直接将数据提取到数据库,那么“PDF编辑器”这个工具自身就丧失了存在意义。
AWS Textract的定价,在基础文字检测方面,是每页0.0015美元。在表格提取方面,是每页0.015美元。在表单处理方面,是每页0.05美元。云厂商习惯于把每一个功能,封装成昂贵的API出售。DeepSeek的开源策略,让企业发现,原来自己不需要交这笔“过路费”。
可以在本地部署一个开源的DeepSeek模型的开发者,既保护了隐私,还省下了巨额预算。然而对于更广泛的商业世界而言,当机器“读书”不再昂贵时,新的机会正在形成。
原本因OCR成本高昂致使无法达成的小微企业征信服务变得可行了,大规模的试卷批改以及学习资料数字化成为了现实,病历、检查报告的自动化处理和的分析得以普及了,合同审查、案例检索的智能化升级也将会加速。
开源生态的胜利
需要留意的是,DeepSeek - OCR2进行变动,采用属于阿里巴巴的轻量级的千问Qwen2 - 0.5b模型,将其用于取代架构里关键组件当中的一个,这一情况显示出中国开源生态系统在推动人工智能发展这件事情上越发重要的地位,最终明确展现出其重要性。
DeepSeek团队持有这样的看法,即这给朝着统一的全模态编码器前行提供了一条具备希望的途径。在未来,单一编码器或许能够借助配置特定模态的可学习查询,于同一个参数空间当中达成对于图像、音频以及文本的特征提取还有压缩。
此种开源协作模式所带来的,不单单是技术迭代得以加速,不同团队的技术成果能够迅速整合;更为关键的是成本大幅降低,重复造轮子的情况得以避免,研发成本实现分摊;最终呈现出的是整个生态系统走向繁荣,更多开发者能够基于开源模型构建应用。
DeepSeek - OCR2的推出,可不是简简单单的一则技术方面的消息。它意味着,历经计算机行业几十年的OCR这项技术,正式宣告完成了其过往的使命,即从原本那种得花高价去购置的“服务”,转变成为如同水电煤这般的“基础设施”。
依据DeepSeek所公布的技术报告来看,该模型一方面保持着极高的精度,另一方面,其严格地对计算成本进行了控制,在此之时,它的视觉Token数量处在256至1120的范围之间。这样一种极致的效率优化,恰恰就是基础设施化的典型特征。
对Adobe以及和合合信息而言,凛冬已然来临;然而对于更为广阔的商业世界来讲,在机器“读书”不再具备高昂成本之时,存有于纸张、PDF以及图片之中的海量数据资产,才切实迎来了被唤醒的那一刻。
被DeepSeek革掉命的那种东西,不是某一家公司的命,而是旧时代里,有关“获取信息需要高昂成本”的命。
在如今这个由AI对所有事物进行重塑的时代之中,任何一种构建在信息不一样以及技术存在门槛基础之上的商业模式,都势必会遭遇到源自开源世界的那种以高维度向低维度展开冲击的情况。而这样的状况,也许只不过才刚刚开始而已。


Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7
地址: EMAIL:1210524564@qq.com
Powered by PHPYun.