EuroHPC:在欧洲怎么拿到超算使用权,以及它要多少钱

大多数本可以从大规模算力中受益的公司,从来没考虑过 EuroHPC,因为超级计算听上去像是给物理学家用的东西。十年前这话基本没错。现在不成立了,而且使用途径比几乎所有人以为的都要开放。
EuroHPC 联合企业采购并运营欧洲超级计算机,资助围绕它们的软件和技能,而对公司最有用的是:它分配这些机器的使用权。对合适的负载来说,这种使用权比商业云便宜得多,对某些负载来说它是免费的。
EuroHPC 究竟是什么
欧盟、参与国和私营成员之间的一个联合企业,资金来自 数字欧洲计划、地平线欧洲 和连接欧洲设施,外加国家出资。
它的工作分为三部分:
基础设施。 在全欧洲采购和运营超级计算机,从中端系统到百亿亿次级机器,托管在各成员国的站点。也包括我们 InvestAI 指南 中描述的人工智能工厂,那是挂靠在这些站点上、面向人工智能做过优化的算力。
研究与创新。 资助软件栈、应用,以及越来越多的欧洲处理器技术。
技能与使用权。 能力中心、培训,以及配额征集,也就是你真正用上这些机器的入口。
最后这部分才是公司应该关心的,而大多数公司不知道它存在。
使用途径
使用权通过征集分配,而征集有若干种,特征差别很大。找对那一种比其他任何事都重要。
基准测试与开发使用权
小额配额,用来测试你的代码能不能跑、扩展性如何。申请轻量,周转快,给的算力也少。
对任何从没用过这类系统的人来说,这是正确的起点。它只花你一张申请表,却能告诉你需要知道的两件事:你的负载究竟跑不跑得起来,以及它的扩展是否有效。
常规使用权
获得可观配额的主要途径。同行评审,按固定周期征集,面向有清晰科学或技术论证的项目。配额更大,周期更长。
评审是动真格的,提案需要一份技术论证:你在算什么、为什么需要这个规模,以及能证明你的代码确实跑得动的数据。
极大规模使用权
面向需要占用最大机器很大比例的项目。少见,评审很重,不是大多数公司起步的地方。
人工智能与行业专用使用权
更新的通道,明确面向人工智能负载和工业用户,包括中小企业和初创企业。它们的流程比传统科学配额轻,是为研究机构以外的组织设计的。
如果你是公司而不是大学,这通常就是你的途径。
通过人工智能工厂获得使用权
人工智能工厂有自己的一套使用安排,对不是高性能计算专家的用户,通常会提供更多支持。如果你的负载是模型训练或微调而不是传统仿真,从这里开始。
它要多少钱
对研究和许多工业用途来说,分配到的算力是免费提供的,因为机器由公共资金资助,而配额流程本身就是配给机制,价格不是。
也存在需要付费的商业使用安排,通常针对直接商业性、无开放性要求的工作。即便如此,对持续的大型任务而言,其定价通常仍优于商业云,因为你不必为自己用不上的弹性容量支付溢价。
真正的成本不在算力,在工程。
诚实的部分:这不是云
这里需要校准预期,因为这正是公司尝试 EuroHPC 后放弃的原因。
你拿不到一台有 root 权限的虚拟机。 你拿到的是一个共享集群上的配额,带作业调度器,通常是 Slurm。你把作业提交到队列。资源可用时它们才运行。交互式工作受限。
软件环境是基于模块的,不是容器优先,不过容器支持正在变多。你的依赖可能得针对站点自带的库重新编译。
文件系统是共享的,而且有策略。 临时空间会被清理。家目录有配额。数据进出需要规划,对大型数据集则需要认真规划。
网络是为紧耦合并行作业优化的,不是为相互调用的微服务。如果你的负载是一个分布式系统而不是一次并行计算,那这个环境不对。
排队时间是真实的。 大型作业可能要等。如果你需要在一小时内按需拿到结果,这不是你的基础设施。
弹性不存在。 你有一个配额。你不能因为今天忙就扩容。
这些加起来就是:EuroHPC 非常适合大型、可计划、并行或批处理的负载。它不适合交互式、弹性、按需或服务形态的负载。
哪些负载真正合适
规模化的模型训练和微调。 显而易见的现代场景,也正是人工智能工厂为之而建的。
大规模仿真。 计算流体力学、分子动力学、结构分析、气候与天气、电磁学。传统场景,至今仍是最大的用户。
大规模批量推理或数据集处理。 一次性处理大型语料、规模化生成嵌入、批量打分。
任何你目前在计划性作业上大量花钱买云 GPU 或 CPU 时间的场景。 这是商业检验。如果你批处理工作的月度云算力账单不小,而且作业是可计划的,就去做这个对比。
任何数据不能离开欧盟的场景。 受行业规则约束的敏感数据、健康数据、公共部门数据。在欧盟境内、受欧盟司法管辖的算力会改变分析结论,而它与我们 《通用数据保护条例》指南 中讨论的跨境传输问题相连。
实际的入口
从一个基准测试配额开始。 小、快,而且能在你投入之前回答这条路是否可行。
联系国家能力中心。 每个参与国都有一个。它们的存在正是为了帮刚接触高性能计算的组织,服务免费,而且会诚实告诉你,你的负载合不合适。
明确为移植工作留预算。 如果你的团队只在托管云上跑过,那么让一个负载在高性能计算配额上高效运行是一个实打实的工程项目。工作量不算大,但绝不是零。第一次上手往往只发挥出应有性能的一小部分,这很常见。
如果你是公司,先看人工智能和工业专用通道。 传统的科学配额流程不是围绕你设计的。
尽早规划数据搬运。 把好几个 TB 的数据搬进搬出,是一件有自己前置周期的物流活。
它在战略上的位置
EuroHPC 是欧洲算力战略的基础层。我们 InvestAI 指南 中描述的人工智能工厂依托于它。超级工厂扩展它。《芯片法案》 下的处理器工作最终瞄准的是减少它之下的硬件依赖。而 《云与人工智能发展法案》 是围绕这一整套的监管框架。
对公司来说,战略意义小于实际意义。决定训练任务跑在哪里时,你不太可能去想欧洲技术主权。但你很可能在意算力只要商业价格的零头。
它在全局中的位置
完整的资助与使用版图梳理在我们的 欧盟技术资助指南 中。为 EuroHPC 出了很大一部分资金的那个计划,见我们的 数字欧洲计划指南。
需要帮助时
我们为在欧洲经营的公司构建数据平台、人工智能管道和算力密集型系统,包括这样一项工作:把负载从笔记本或云 GPU 搬到计划性的高性能计算配额上,而不用为此赔上一个季度。
如果你有受算力限制的负载,想要一个关于 EuroHPC 使用权是否有帮助、移植需要付出什么的现实评估,请写信到 office@c9group.dev。关于我们的基础设施工作,更多内容见 AWS 成本优化页面。