电话:
关闭
您当前的位置:首页 > 职场资讯 > 社保

5月29日Claude新模型发布及融资情况,功能提升但无架构突破

来源:网络整理 时间:2026-05-31 作者:佚名 浏览量:

Claude再次成为焦点。

5月29日的凌晨时分, AI行业再度上演了一回“深夜突袭”。美国的大模型公司Anthropic, 正式发布了Claude最新的旗舰模型Opus 4.8, 并且同步宣布完成了H轮650亿美元的融资, 投后的估值高达9650亿美元。在不到三个月的那段时间里, Anthropic的估值增长了约154%, 正式超越了竞争对手OpenAI。

本次进行模型更新, 其覆盖了编码, 覆盖了智能体任务, 覆盖了推理与知识工作等核心能力, 其中重点对模型的“诚实度”予以提升, 并且新增了支持大规模复杂任务并行处理的“动态工作流”功能。

然而, 要是仅仅从功能列表去看, 就极易高估此次发布所具有的意义。事实上, Opus 4.8并未带来架构层面那种具有颠覆性的突破, 从事该行业的人员都一致觉得它属于“渐进式进步”。

但是呢, 这次发布传递出了一个信号, 这信号是明确的, 那就是大模型的竞争重心, 正在发生转变, 从技术突破方面, 转向了其他方面, 转向了谁更加可靠, 转向了谁更好用, 转向了谁性价比更高。

这般转向, 同样在Claude的迭代节奏里有所展现, Opus 4.8距离上一版本Opus 4.7发布, 仅仅过去了43天。快速的更新速率, 既是大模型竞争白热化的一种体现, 又反映出Anthropic当下的状况。它得用更快的节奏, 同时向开发者、企业客户以及资本市场表明, Claude是值得信赖的。

01.进步有限,“诚实”是最大亮点

先看官方发布的Opus 4.8成绩单。

在编程之类的主流基准测试里, 在多学科推理之类的主流基准测试中, 在金融分析之类的主流基准测试中, Opus 4.8的得分全方位超越了前代Opus 4.7, 并且比分还超过了竞争对手GPT-5.5;然而有个需要加以关注的细节, 有一个值得予以注意的情况便是: 在跟开发者真实工作流过最息息相关的“终端编码”测试, 也就是Terminal-Bench 2.但是即便这个幅度大到是本次所有单项测试里最大的提升幅度, 可Opus 4.8的得分最后还是在该项测试中, 以74.6%, 落后于GPT-5.5的78.2%。

不过,这个差距在实际使用中的影响,可能比数字看起来要小。

资深开发者张钰枢告知「AIX财经」, 模型于“终端编码”方面的表现, 跟开发者具体运用的工作流紧密相连, 倘若日常极为依赖命令行逐一条来调试, GPT - 5.5的领先或许会更便利顺手些;但要是核心工作是在IDE里阅读代码、领会架构、进行重构或者修复复杂缺陷, Claude在SWE - Bench Pro上的优势就更具参考价值了。

从他的角度来看, 对于多数应用层开发者而言, 终端操作方面呈现出的差距情形, 更多体现的是厂商在各自所拥有工具链以及推行的优化策略之际, 有着不同侧面的倚重倾向性表达事态, 并非是模型底层编码能力层面存在非常重要的、起决定性根本作用的、呈现关键性不具备状况。所以, 这种状况于实际的开发工作进程当中所产生的影响程度, 并不显得突出显著异常, 是能够被接受认可的一种存在状态。

先来看这次更新, 相比编码能力那细微的得与失, 更值得我们去留意关注的, 其实是Anthropic着重精心打磨出来的“诚实度”。从官方给出的数据可以看出, Opus 4.8所编写的代码当中, 存在缺陷却被漏报的概率究竟是多少, 只有Opus 4.7的大约四分之一, 而且, 在“欺骗用户”或者“协助干坏事”这般行为上面所呈现出来的发生率也是明显显著下降了。

但这个并非不存在争议的数字, 资深AI从业者方思明告知了「AIX财经」, 自己并未察觉到模型变得尤为诚实, “这种进步大概更多是反映在那些沟通话术或者表达方式里细微的调整之上。”。

Anthropic官方称, 其于训练进程里察觉到一个潜在矛盾, 那就是模型在进行推理之际, 愈发倾向于“揣测评分者意图”, 这意味着, 它大概正在生成“自己正被测试”的感知, 进而给出它觉得能获高分的答案, 而非真正最优化或最真实的解答, 这对它所追寻的“诚实”原则, 造成了一定挑战。

总体而言, Opus 4.8, 更像是一回扎实然而幅度受限的小版本迭代, 在实际体验当中, 提升感觉并不明显。

方思明给出的评价具有相当代表性, 他觉得“Opus4.8跟Opus4.6以及GPT-5.5比起来, 谈不上是那种跨越等级的提升, 更多的是针对前一个版本Opus4.7做的修复与优化。”鉴于之前4.7版本呈现出的表现, 对于Anthropic来讲, 当下最为急切的任务是重新建立用户对于AI可靠性的信任, 然而, 仅仅依据目前公布出来的数据与所呈现出来的表现, 依旧没办法让整个市场相信Claude已然是“最值得托付的那一个”。

02.“动态工作流”成新王牌,但成本是个问题

有不止一位从业者讲, 这次发布, 最值得留意的, 不光是Opus 4.8的各项评价分数, 还有同步推出的Dynamic Workflows(动态的工作流程)。值得说一说的是, Anthropic实验室里能力更厉害的Claude Mythos Preview没有随这次登场而向外面开放。也就说, Opus 4.8是现阶段最强的“通用能用版本”, 但不是Anthropic手上最强的那张‘牌’。

或许可以这样来诠释动态工作流, Claude当前拥有扮演“项目总监”这一角色的能力, 它能够将一个大型且复杂的任务, 自动地拆解为可数以百计的子任务, 之后将其分派给多个“子智能体”去并行处理, 在中间结果历经交叉验证以后, 再进行整合并输出给用户。

Anthropic为此给出了一个官方的示例, 开发者Jarred Sumner借助动态工作流, 把Bun的底层语言由Zig迁移至Rust , 产生了大约75万行Rust代码, 这75万行代码通过了现有测试套件里的99.8% , 从第一次commit开始一直到最终merge , 一共历时11天。

这意味着, 在不到两星期的时间里, Claude就达成了一项大型底层重构项目, 而该项目一般来讲, 是需要高级工程师团队耗费数月时间才能完成的。

认为的一位从业者表示, 出现Dynamic Workflows标志着Claude的主张, 从按次收费的“对话/生成”服务, 转变成按流程以及结果收费的“复杂任务交付”服务, 企业所进行购买的, 是完成一项具体且复杂工作流程的确定性。

不过,这张“王牌”在业内也引发了不少质疑。

在技术层面,有观点认为其创新性有限。

張鈺樞表明, 动态工作流于架构方面并非属于那种起到颠覆性影响的设计, 其通过演示案例所证实的更多的是关于“技术可行性”这一内容, 距离能够在真实的生产环境里实现稳定运作仍然存在着明显的工程化方面的距离, 在此之中涉及到诸如性能、资源以及边缘情况等一系列呈现出复杂态势的挑战。

更为现实的制约来自经济层面。

方思明表明, 那种模式跟常规对话相比, 耗费更多的Token, 成本方面的问题特别显著。因为要同时去调度十几个智能体一块儿协同开展工作, 它的成本会一下子往上升。哪怕是一个工作流设计得极为精巧, 可要是最终的效果没有明显的提升, 而成本却增长了好几倍, 对于企业来讲依旧是不合算的。

他接着补充, 现实里不是所有企业都具备高预算, 微软曾说, 在一些场景下, 运用AI的成本比人力成本高了, 现在, 有个成本可能是普通AI数倍的解决方案, 它带来的价值能不能有相应倍数的回报, 这要市场和时间去验证,在他的想法里, 这个功能的推出自身也带着一定的实验与探索性质。

为了降低使用门槛,Anthropic在成本端也做了调整。

一方面, 新增了effort control(投入控制)机制, 用户能够依据任务的复杂程度以及需求, 手动去调节Claude在任务方面的“思考投入”强度。比如说, 在“High模式”的情形下, Claude会开展更为深度的推理, 以此来追求更为优质的结果;然而在“轻量模式”的状况下, 便能够达成更快的响应速度以及更低的token消耗。

另一方面, 于定价策略方面, Opus 4.8的常规模式, 维持了跟之前版本一样的价格, 依旧是每百万token 5美元(输入)/ 25美元(输出)。只是快速模式的价格, 有了大幅度的下降, 从4.7时代那30美元(输入)/ 150美元(输出), 降低到了10美元(输入)/ 50美元(输出)。在保持速度差不多的前提下, 价格降到了原来的大约三分之一, 性价比有着明显的提升。

尽管降价能够于一定程度之内对成本压力起到缓和作用, 可是动态工作流自身所存在的 ROI 问题, 依旧属于企业切实进入实际行动之前无法避开的那道障碍。

03.按月迭代背后,是技术与商业的双重压力

Claude Opus 4.8的发布时刻, 距离上一个版本Opus 4.7仅仅间隔了43天, 这般紧凑的迭代步调, 恰恰是技术跟商业压力相叠加的直接呈现。

从技术层面来讲, 此次快速迭代, 被部分从事该行业的人员, 视作是一回非得要做的修复。

因为自适应推理体验不好, Opus 4.7被很多人批评, 在一些场景当中, 这个功能没办法合理地去分配推理资源, 这使得模型在面对复杂问题时, 过早地就省力, 导致得出的答案很草率, 推理链条也残缺不全。方思明直接说, “Opus4.8主要的目的就是修复Opus4.7留下来的问题, 在开发者群体中, Opus4.7绝对不是一个口碑特别好的模型。”。

与此同时,外部压力也不允许Anthropic慢下来。

OpenAI最新发布的GPT - 5.5在多项基准测试里持续保持领先, 这是竞争对手的情况, Google Gemini依靠深度融入谷歌生态所具备的分发优势形成了另一维度的竞争态势, 方思明观察到了这些, 这次发布在一定程度上还是Anthropic与OpenAI在“舆论声量上的直接对冲”。

这背后存在着一个更深层次的行业现实情况, 并非仅有一位从业者表达过这样的观点, 当下大模型在架构方面已经很难创造出具有颠覆性的差距, 竞争的关键要点正逐步朝着工程化实现以及工作流塑造方向转变。

这意味着, 是这样的情况, 即谁率先将AI融入企业日常生产流程之中, 那么谁便占据到下一阶段的核心位置。“动态工作流”被推出了, 这正是Anthropic尝试在这一新维度上面率先进行布局, 把赌注押在复杂任务的自动化交付能力上, 而不是仅仅依靠单项测试分数的那种微弱领先状态。

而最直接的压力,来自资本市场。

在发布新模型的同一天, Anthropic宣称完成了650亿美元的H轮融资, 其估值被提升到了9650亿美元, 而在2026年2月完成G轮融资的时候, 它的估值仅仅是3800亿美元, 三个月内增长的幅度大约是154%, 距离万亿美元仅仅差一步, 这样的数字放在任何一个行业当中都能够称得上是惊人的。

支撑着这个估值的, 乃是Anthropic的收入增速, 有报道声称, 该公司预估二季度营收将会达到109亿美元, 并且有希望首次达成季度盈利。

尽管巨额融资所带来的弹药是极为充足的, 然而与这一情况相对应的是, 资本市场存在着同样巨大的期待, 投资者是需要看到与估值相匹配的实质性进展的。

Opus 4.8肩负着这个“证明自身”的使命, 它于基准测试里的表现, 动态工作流所勾勒的自动化憧憬, 以及全线朝向企业级市场的产品升级趋向, 一同搭建起支撑这近万亿估值的根基, 然而动态工作流的投资回报率依旧难以进行量化, 那“更诚信”的模型承诺是否能够切实获取企业客户的长久信赖, 尚需市场的最终审核。

鉴于此, Opus 4.8更近乎是一回信心的释放之举, 借由43天推出一个版本的这般节奏向市场表明, 它依旧处于加速的状态之中。然而, 能否保持稳定的运行态势, 才是这家公司在后续阶段真正需要去做的关键之事。

*应受访者要求,文中方思明为化名。

分享到:
客服服务热线
24小时服务
微信公众号
手机浏览

Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7

地址: EMAIL:1210524564@qq.com

Powered by PHPYun.

用微信扫一扫