电话:
关闭
您当前的位置:首页 > 职场资讯 > 社保

AI未来航向:算力、算法与数据的三角平衡,谁主沉浮?|ICDM 2025前瞻

来源:网络整理 时间:2025-11-19 作者:佚名 浏览量:

华盛顿特区在11月时,秋意正浓厚,为期四天的IEEE国际数据挖掘会议ICDM 2025,于15日结束了,这场历经二十多年的学术盛会,聚集了全球数据科学、AI与机器学习领域的顶尖学者以及业界精英,会议举行了超过40场专题研讨会、技术报告和“BlueSky Track”创新论坛,描绘出了AI发展的前沿景象。在由算力、算法以及数据所共同构建而成的AI宇宙范畴里面,哪种力量正在起主导作用,从而引领着去向未来的航行方向呢,这其中存在着一个贯穿始终的核心思辨 。

三角关系的精妙平衡

大会承认,算力乃是当下AI发展不可缺少的引擎,于此同时,大会提出了更为深刻的见解,即算力、算法与数据,这三者构成了一个动态的平衡体。强大的算力,不仅驱动着大型模型的训练,还赋予了研究者大规模测试与验证新算法的能力,进而加速了算法本身的进化。另一方面,与会者还提出,数据的角色正在历经转变,从原本所充当的被动的“燃料”,转变成主动的“瓶颈”。互联网领域公开的人文数据红利已然到达顶点,虽说多模态数据以及合成数据在后续几年还能够对AI的发展起到支撑作用,然而高质量的、处于专业领域的、可确认的精标数据,像医院的临床事故、工厂的设备故障等这类数据,依旧十分稀缺,而这些数据将会成为决定下一代AI模型“智商”以及可靠性的关键因素。

有人于讨论之际,以玩笑之口吻,举了个事例:在未来之实验室里,有一位年轻的工程师,发现了一份属于21世纪初的全球天气原始日志。当同事们全神贯注于构建耗费海量算力的巨型模型之时,她却选择去清理并且语境化这些粗糙的、年代久远的数据。数据苏醒之后,揭示出了关于城市洪水的隐藏模式,其洞见超出了任何复杂模型的推演能力。她因此顿悟:真正的力量并非全然源自调整模型的参数,还在于对数据源头本身的梳理以及理解。在算力至上的时代里,数据乃是那位被遗忘的真正英雄。

三位守护者的启示录

于AI的宇宙之内,有三位守护者,它们执掌着各异的权柄 ,算力身为开凿山河的巨人,凭借其磅礴之力为一切奠定基础 ;算法犹如编织法则的精灵,于逻辑的脉络里赋予智能以形态 ;数据恰似奔流不息的星河,既是智慧的源头,却也隐匿着误导的漩涡 。本届大会的两场核心主题演讲,以及其中一场专题研讨 ,仿若三位守护者的轻声细语 ,揭示出它们彼此之间相生相克的奥秘 。

1.算法精灵的编织:打通联结的“关系基础模型”。

斯坦福大学教授尤雷•莱斯科夫(Jure Leskovec)尝试去努力调和三大元素,他一开场就直接指向核心痛点,他说我们都历经目睹了 LLM 在文本、图像方面的爆发,然而企业 80%的核心数据,也就是交易、供应链、客户关系,这些都是结构化的、关系型的网络,那为什么预测“欺诈”或“流失”仍然需要数据科学家花费数月时间,去编写数百行代码来搭建脆弱的模型呢?

在他的认知当中,AI需具备两个大脑,其中LLM构建起一个“推理大脑”用于处理非结构化数据,然而企业却欠缺另一个能够理解数据之间复杂关系的“预测大脑”。二者呈现出的割裂状态,乃是提高效率的瓶颈所在。紧接着,他展示了其团队所打造的“关系基础模型”,也就是RFM,它并非是要去取代LLM,而是一个专门为结构化数据而产生的、与LLM完美互补的预训练模型。它就好似一个对SQL颇为精通的AI,只要将其指向数据库,然后提出像“预测未来30天客户流失风险”这样的查询,在短短几秒之内它就能输出结论,根本不需要进行特征工程和模型微调。

其背后所具备的创新之处,在于把数据库表转变为“时序关系图”,并且借助图结构Transformer达成跨表以及跨时间的推理。莱斯科夫着重表明,这一算法所取得的突破,其意义体现在极大程度地削减了对领域专业知识以及漫长数据准备流程的依赖,进而把宝贵的算力从重复性劳动之中解放出来,专心致力于更为本质的创新。他所做出的演示能够证实,在零样本的状况之下,RFM在多项任务方面的预测准确率已然超过了精心予以训练的监督模型,而且速度提高了千倍。这意味着,精巧的算法构思,正变为释放算力潜能、解决数据繁杂性的关键之匙。

瓶颈技术__力量瓶颈期

2.数据星河的导航:以网络模型驾驭生物复杂性。

哈佛大学担任教授职位的约翰·奎肯布什(John Quackenbush),乃是一位于生物医学那犹如浩瀚星河般的数据领域里,小心翼翼地展开航行的导航者 。他在开篇之际就发出警示 :“生物学并非呈现为一条直线的形态,而是呈现出一团乱象丛生的状态 。”他持有这样的观点 :在面对基因组、转录组等所产生的具备高维度、充满嘈杂特征的组学数据时 ,仅仅单纯依靠算力去进行那种蛮力式的计算 ,或者寄希望于AI仅仅凭借从数据当中便能够 “自发” 地领会所有规律 ,这属于一种危险的简化论做法 。

他详述道,原始数据是极其不足的 ,我们必定需要借助“网络”这一模型 来赋予数据结构还有意义 。在他所进行的描绘之内 ,有着恰似精密滤网那般的网络模型是可以从数据的噪声里筛选出真实信号的 ,能揭示出微小遗传变异经由复杂相互作用是怎样最终致使疾病表型呈显的 。他呈现出了怎样依凭网络模型把多模态数据整合起来 ,以及怎样将环境暴露因素和基因表达关联起来 ,进而达成更精准的癌症风险评估还有亚型分类 。

奎肯布什的关键论点为,在像生物医学这种有着强机制限制的领域,未来的AI发展必然得是“模型引导”的,高质量以及专业注释的数据是绝对不可或缺的燃料,然而要是没有正确的算法模型(像是网络模型)当作导航图,即便算力再强大,也有可能在数据组成的迷宫里得出荒诞不经的结论,从而陷入“垃圾进,垃圾出”的圈套,他的工作表明,数据的价值,非得通过与之相匹配的、具备领域洞察能力的算法模型,才能够被切实解锁。

3.算力巨人的务实派:金融数据海洋中的精准捕捞。

那位来自宾夕法尼亚大学的富兰克林学者Wesley Leeroy建造的AI模型,还有他的合作者一同构建的该AI模型,能够代表算力巨人在具体领域也就是金融数据挖掘当中具备的务实应用。他们的研究关键考量如何借助像GNN、CNN、GRU这样强大的计算架构,以便在海量的、具有多模态特性呈现如结构化财报、非结构化SEC文件的各类金融数据里精准识别出欺诈等异常模式。他们所构建的这个模型在辨别真伪的时候精准值达可以到92%准确率,。

另一种驱动逻辑在他们的工作中得到体现:在特定场景里,丰富且高质量的专业数据自身,能够推动AI能力的边界。他们依托谷歌DeepMind构造的模型,凭借算力去处理并融合这些复杂数据源。然而,原始金融数据存在充满噪声、缺失值以及尺度不一致的问题,这一点他们明确意识到。若不加处理就把数据投入计算能力的熔炉,只会打造出有缺陷的模型,在现实表现不尽如人意。

因而,Wesley着重指出严格的数据预处理、还有那特征工程以及模型设计,实际上呀是靠着算法上所付出的努力,以此来保证数据质量,进而使得每一份算力消耗都具备价值。他们所拥有的成功案例已然表明,在像金融这种数据驱动属性极为强烈的领域当中,AI的进步源自于一个紧密相连的循环:专业数据提出了需求,算法展开优化与净化,算力达成规模化计算。在此处,数据是起点同时也是终点,算法是效率的倍增工具,而算力则是把这所有一切变为现实的坚固基础。

ICDM 2025会议明确显示,AI的前景不是被单一因素掌控。当下算力是关键资源,是推动所有之事的动力源泉;算法是迈进未来的关键工具,专注于更有效地运用能源和数据;至于数据,尤其是高质量的专业数据,却是决定AI应用深度及可靠性的基础。这三者所形成的,是一个相互依存、相互影响的循环体系。短期内,算力方面的瓶颈依旧显著突出,然而从长远视角来看,存在这样一种研究,有着能够巧妙实现三者平衡的能力,这种研究可让算法精妙地去调和算力与数据之间的矛盾,它将最终引领AI穿越瓶颈,从而抵达更为广阔的全新前沿领域。

(作者系美国马里兰大学教授)

分享到:
客服服务热线
24小时服务
微信公众号
手机浏览

Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7

地址: EMAIL:1210524564@qq.com

Powered by PHPYun.

用微信扫一扫