中国式现代化奋进者｜让大模型跑起来，这个大装置表现全球领先 - 三农

2024-04-01三农

AI大模型是当前全球最热的产业，中国大模型企业正飞速发展。而「大模型」离不开「大装置」，如果没有以算力为核心的基础设施作为支撑，大模型根本就跑不起来。

上海有这样一支团队，打造了亚洲最大的人工智能计算中心之一——商汤临港AIDC。它背后的SenseCore商汤大装置团队，由400余名多领域人才所组成，分布在上海、北京和深圳等地。

商汤临港AIDC。受访者供图

目前，SenseCore商汤大装置管理的算力，已实现全国联网的统一调度，在上海、深圳、广州、福州、济南、重庆等地都拓展了新的计算节点，总算力规模已高达12000 petaFLOPS。

这个大装置的算力，在支持商汤自身大模型研发的同时，也支持外部客户训练大模型和应用部署。专业地说，SenseCore商汤大装置的强大算力，可支撑超过20个千亿超大模型同时训练，并支持万亿参数大模型的全生命周期生成。

更通俗地理解，如今我们在办公场景、购物、聊天、社交、游戏等领域享受的生成式AI技术服务，很多都依托SenseCore商汤大装置提供算力。比如，京东、金山办公等，都调用了商汤的算力和模型。

根据国际知名调研机构弗若斯特沙利文（Frost & Sullivan）联合头豹研究院发布的【2023年中国AI开发平台市场报告】，商汤大装置已成为AI开发平台的领军者，市场综合竞争表现位居国内第一、全球第二，仅次于亚马逊云。

基于SenseCore商汤大装置提供的算力，在四方体的不同立面上呈现出与平面图像一样的画面。本文图片除注明外，均为澎湃新闻记者李佳蔚图

生成式AI成为核心业务

商汤是中国最早一批投入人工智能基础设施建设的公司之一，在公司成立的第10个年头，2023年商汤迎来了生成式AI业务的「爆发式增长」。

2024年3月下旬，商汤披露了其2023年业绩。财报显示，2023年商汤实现总收入34亿元，借助「大装置+大模型」的协同布局，其生成式AI业务创造了11.8亿元的收入，收入增长率达200%，占该集团总收入的35%。

也就是说，生成式AI业务已成为商汤从无到有并超过10亿元收入体量的核心业务。而在这背后，SenseCore商汤大装置的贡献至为关键。

商汤科技董秘办董事总经理盛世伟介绍，2018年前后，商汤开始每年投入到专为AI原生打造的智算云服务平台——SenseCore商汤大装置，并建设上海临港超算中心。

经过5年的努力和发展，目前商汤大装置的总算力规模已突破性地增长至12,000 petaFLOPS，上线GPU数量高达45,000卡，这在国内大模型基础设施中非常稀缺。

与此同时，2022年，作为商汤大装置重要载体的人工智能计算中心（AIDC）在上海临港正式投入运营，这里也成为亚洲最大人工智能计算中心之一。

得益于大装置算力和数据规模的支持，商汤研发的底座大模型「日日新」得以持续优化。以「日日新」4.0版本为例，目前其在代码编写、数据分析和医疗问答等多个场景中展现的能力，已超过ChatGPT-3.5。

目前，SenseCore 商汤大装置沉淀了整套大模型基础设施能力，不仅可服务于众多企业和科研院所的开发者，很快也会向个人开发者全面开放。

盛世伟表示，站在AI 2.0的最前沿，商汤进一步推出「模型即服务」商业模式，使客户能够轻松微调和使用各类生成式AI功能，无需承担建设和管理底层基础设施的负担，这也为商汤在市场中带来众多正面评价。

商汤大装置+大模型，根据文字生成高清图片。

实现「万卡互联」超30天稳定训练

大模型时代，计算量、模型参数和数据集规模都在快速增长从而不断推升模型的「智能」水平，其背后遵循的就是尺度定律。

同时，随着AI在各行各业的落地向深水区挺进，人工智能基础设施化已成为必然趋势。这也让商汤大装置有了更加广阔的发展天地。

「现在大家都知道，模型的参数都是动辄几千亿、上万亿，如果没有一个大的集群，根本没有办法做这件事情，所以能够把这些卡连起来是一个非常硬的功夫。」盛世伟说，目前商汤的工程化能力做到了国内领先。

盛世伟表示，SenseCore商汤大装置是国内训练大模型最为先进的基础设施之一，2023年实现了对万亿参数大模型的生产支持，还在互联规模、加速效率和稳定性上保持业界领先水平。

目前，商汤大装置已最大实现了万卡的超大集群互联，并保持90%的加速效率。在训练稳定性上，这个大装置实现了超30天稳定训练不间断的能力，而出现训练间断时的诊断恢复时长也优化到了半小时。

此外，在推理侧，商汤的自研的推理引擎在大语言、多模态模型上的性能表现提升了2倍，资源利用率提升了40%，为用户提供极致性价比服务。

值得关注的是，商汤推出的「日日新」4.0，于2024年2月在代码编写、数据分析和医疗问答等多场景中达到了与GPT-4相匹配的能力，同时开源了7B和20B两种参数规格的基模型，性能超Llama2和Gemma。

「在即将到来的4月下旬，我们会有一个技术交流日，届时将展示我们更新的‘日日新’5.0大模型的能力。」盛世伟提前预告，预计4月份发布「日日新5.0」版本，性能全面对标GPT4-Turbo。

商汤国产化算力机房一角。

构建智能计算新生态

盛世伟介绍，SenseCore商汤大装置团队由400余名多领域人才所组成，他们分布在上海、北京和深圳等地。

「在大装置团队当中，不乏身怀艺术细胞、音乐天赋，但又拥有对学术执着的科学家，」盛世伟说，他们能够以独特的视角和激情，为商汤大装置的发展注入创新活力。

SenseCore商汤大装置的首席科学家为林达华教授，在深度学习和神经网络领域具有很高的学术地位和成就。林达华师从汤晓鸥教授，也是商汤联合创始人，香港中文大学信息工程硕士、美国麻省理工学院计算机科学博士。林达华在AI开源社区有显著贡献，主导了商汤的多个开源项目，同时也是大模型研发的牵头人。

接下来，商汤大装置团队还将加速大模型能力下沉，构建智能计算新生态。

第一，加速国产算力布局。通过与众多国产算力厂商合作，商汤与上下游产业伙伴共同推动国产生态建设，完成多款芯片与框架适配，落地多个千卡级别的国产算力集群，积极推进芯片评价标准和体系的完善，加速整个国产算力商业化进程。

第二，持续探索尺度定律边界（Scaling laws）。随着大模型的参数量朝向万亿以上级别激增，稳定、高效的超大规模算力调度和训推引擎成为核心基石。

第三，建设面向开发者友好的AI基础设施。面对愈发高频次、高效率的模型迭代需求，SenseCore商汤大装置拥有领先的AI原生云算力产品体系，为客户打造0门槛、一站式的极致开发体验，缩短大模型开发周期。