Back to Articles

InvestAI、人工智能工厂与人工智能超级工厂:欧洲的算力建设

compute cluster racks in a server room

当前欧洲技术政策中最大的一笔单一赌注不是一部法规。它是一次尝试:在欧洲建起足够的人工智能算力,使欧洲公司不必把算力全部从别处租来。

InvestAI 的目标是为欧盟的人工智能投资动员 2000 亿欧元,其中包括一支 200 亿欧元的欧洲人工智能超级工厂基金。这个大数字能不能兑现,是个合理的疑问。而已经落到实处的那部分,更具体,也更有直接用处。

三个层级

令人困惑的地方在于,有若干名称相近的东西在做不同的工作。它们大致构成一个层级。

EuroHPC 超级计算机

已有的基础层。通过 EuroHPC 联合企业采购和运营的欧洲超级计算机,其中一些位居世界最快之列。为科学计算而建,越来越多地用于人工智能。见我们的 EuroHPC 指南

人工智能工厂

挂靠在 EuroHPC 超级计算站点上、面向人工智能做过优化的算力,外加围绕它的一整套服务:数据处理、模型训练支持、专业能力,以及面向初创企业和中小企业的使用通道。

重要的是后半句。人工智能工厂不只是一堆 GPU。它是一处带着明确任务的设施:让那些自己绝无可能运营这类算力的公司真正用上它,而且配有支持人员,帮你把训练任务跑起来。

全欧洲规划了至少 19 个人工智能工厂,目标是 13 个投入运行。

人工智能超级工厂

新增的、规模大得多的一层。其规模意在训练前沿模型,算力大约比人工智能工厂高一个数量级。

设想最多五座。公共承诺涉及约 100 亿欧元,目标是吸引至少 200 亿欧元的私人投资,2026 年初有报道称七个国家的十个候选设施合计约 370 亿欧元。

这些数字之所以来回变,是因为它们把已承诺的公共资金、预期的私人共同投资和国家出资混在一起算,而不同公告统计的口径又不一样。把公布的总额当方向性信息看就好。

它为什么存在

三个理由,值得说清楚,因为它们解释了这些设施实际会优先做什么。

容量。 训练和提供大模型服务所需的算力规模在欧洲原本不存在。想在欧洲训练一个像样模型的公司选择有限。

依赖。 这是战略层面的理由。算力是基础设施,基础设施带来筹码,而欧洲手里的相关筹码非常少。这与 《云与人工智能发展法案》 背后的推理相同。

使用权的不对称。 即便算力存在,使用权也是集中的。一家欧洲初创企业要与购买力大得多的买家争抢容量。人工智能工厂在设计上就明确要给较小的玩家留出容量。

如果你不是在建数据中心,这意味着什么

读到这里的多数公司永远不会去投标运营一座超级工厂。有用的问题是:正在建起来的这些东西,怎么用。

使用人工智能工厂的算力

这是实际的机会,而且被低估了。人工智能工厂之所以存在,部分正是为了让初创企业、中小企业和研究者用上真正大规模的算力。使用权通常通过征集和申请流程获得,而不是刷一张信用卡,而且对符合条件的用户来说,定价远低于商业费率。

如果你有一个确实受算力限制的负载,训练或微调模型的规模已经让云 GPU 成本变得难以承受,那么在断定超大规模云厂商是唯一选择之前,这值得调查一下。

取舍是实打实的。使用权不是即时到手的,环境是高性能计算环境,不是托管云,而且如果你的负载需要弹性按需容量,这就不合适。对于计划好的大型训练任务,它可能便宜得多。

差距在软件层

这里有一个值得说出来的观察。建硬件是资本问题,欧洲现在正在为此花钱。让它可用是软件问题,而这方面的资金少得多。

对那些经验来自托管云服务的团队来说,高性能计算环境并不友好。作业调度器、模块系统、共享文件系统、MPI 和排队策略,跟一个 Kubernetes 集群加一个对象存储完全是两个世界。从一段能在云 GPU 上跑通的训练脚本,到同一个任务在高性能计算配额上高效运行,中间隔着实打实的工程工作。

那道差距对能弥合它的人是机会,对打算使用这些设施却没把它算进去的人则是实打实的成本。

数据本地性改变了可能性

对于数据不便离开欧盟的公司,无论是出于 《通用数据保护条例》 的原因、行业规则还是合同承诺,欧洲算力改变了架构上的可行边界。在欧盟境内、受欧盟司法管辖的设施里拿敏感数据做训练,跟把数据送到别处,完全是两回事。

健康、公共部门和金融服务是最明显的例子,而人工智能工厂也正是在这几个行业设了专门的聚焦方向。

实际怎么拿到使用权

按你的领域找最近的人工智能工厂,而不是按地理位置。 它们有专业聚焦。有的偏健康,有的偏工业,有的偏语言和多语人工智能。对你合适的那个未必在你所在的国家。

看看 EuroHPC 的使用权征集。 它们有若干通道,包括专门面向中小企业和初创企业的,配额规模不同,评审流程也不同。有些相当轻量。

看看某个数字创新中心能否居中牵线。 我们在 数字欧洲计划指南 中描述的欧洲数字创新中心,往往与算力提供方有关系,可以帮助中小企业搞定使用流程。

为移植工作留预算。 如果你的团队从没在高性能计算上跑过,就假设让一个负载高效运行需要一份实打实的工程投入。算力可能便宜。走到能用它的那一步则不是免费的。

诚实的评估

保持一些怀疑是应该的,而且最好把它明确说出来。

公布的大数字里,有很大一部分是还没到位的私人资金。 动员 2000 亿欧元不等于承诺 2000 亿欧元。公共部分是实打实的,规模也小得多。

建算力不等于造出模型能力。 欧洲在前沿人工智能上的差距不只是算力差距。它也是人才集中度、资本市场,以及领先实验室在别处这个事实。算力是必要的,不是充分的。

大型设施的时间表很长。 这种规模的数据中心要建好几年,而在若干候选地点,供电可得性是一项真实约束。宣布的容量和可用的容量是两回事。

芯片是一项依赖。 这些设施里的加速器大多不是在欧洲制造的,这正是 《芯片法案》 想在长得多的时间尺度上处理的问题。

这些都不会让这个计划变得没有意义。它只是让这个计划成为一场长期的基础设施押注:对普通公司来说,近期最主要的好处是能以不错的价格拿到算力,而不是欧洲会冒出一家前沿实验室。

该怎么办

如果你在任何规模上训练或微调模型,花一个下午调查一下人工智能工厂的使用权。其经济性可能非常有利,而大多数公司根本没看过。

如果你现在正在设计一个人工智能产品的架构,就在模型提供商之上加一层抽象。它几乎不花钱,却保住了以后迁到欧洲基础设施的选项。这条建议,《云与人工智能发展法案》 从政策角度在讲,商业常识本来也在讲。

如果你有受算力限制的研究,在断定云就是答案之前,先看看 EuroHPC 的使用途径。

它在全局中的位置

完整的资助版图在我们的 欧盟技术资助指南 中。这之下的算力基础设施见我们的 EuroHPC 指南,再往下的芯片见我们的 芯片法案指南,而你在其上构建之物所受的监管见我们的 人工智能法案透明度指南

需要帮助时

我们为在欧洲经营的公司构建人工智能功能和数据平台,包括那些不光鲜的部分:让训练负载高效运行、把模型提供商抽象出来以便可以切换,以及把数据管道搭起来,让算力使用权真正派上用场,而不是停在纸面上。

如果你在为某个负载考虑欧洲算力,并想要一个关于移植工作量的现实判断,请写信到 office@c9group.dev。关于我们的工作,更多内容见 AWS 成本优化页面欧盟市场进入页面