查看 X 光片并使用电脑的医生

什么是 AI 基础设施?

AI 基础设施的定义

人工智能 (AI) 基础设施包括创建、部署和管理人工智能驱动式应用程序及工作负载所需的硬件和软件。

此技术是 AI 堆栈 的一部分,而 AI堆栈还包括支持在整个 AI 生命周期内构建和运行 AI 解决方案的框架、工具和服务。合适的 AI 基础设施可让开发人员有效创建和部署 AI 与机器学习 (ML) 应用程序,例如虚拟代理、面部识别和语音识别以及计算机视觉

AI 基础设施对于寻求大规模采用和扩展智能体式 AI生成式 AI用于 IT 运营的 AI (AIOps) 及其他 AI 用例的组织来说,也变得至关重要。Statista 的一项研究表明,到 2029 年,全球在 AI 基础设施上的支出预计将增长近两倍。同时,预计该市场将从 2025 年的 3,340 亿美元增长到 2029 年的 9,000 亿美元以上。1

为什么 AI 基础设施如此重要?

AI 基础设施会随着快速扩张的端到端 AI 生态系统而继续发展。例如,组织依赖混合方法,以便将用于训练的共有云服务的可扩展性与用于实现可靠高流量 AI 推断的本地基础设施相结合。

在本地与私有数据中心环境下,内嵌在大型机上的 AI 加速器(如 IBM Z)正在帮助加快开发者工作效率和现代化目标。此需求对于金融和保险等行业尤为重要,因为这些行业通常有严格的法规来规定数据的存储位置和处理位置。

分布式混合基础设施环境的终点,边缘 AI 可让 AI 模型在本地设备(如摄像头和传感器)上运行。此方法可让组织立即生成洞察分析,而无需依赖云基础设施进行处理。

智能体式 AI 也在改变 AI 基础设施的格局。与传统 AI 工具只响应单个查询不同,这些自主 AI 系统能进行推理、规划和行动。在企业环境中,智能体式 AI 支持复杂的多步骤工作流,从而优先考虑安全性、合规性和实时决策。

如今,随着众多不同来源的 AI 驱动式数据量的激增,数据治理和数据主权已成为主要关注点。于是,各组织正在定制其 AI 基础设施以实现 AI 主权目标,以便直接控制其 AI 模型,从而确保组织的独立性、安全性和合规性。

IBM 商业价值研究院 (IBV) 的一项研究中,受访者预测:从现在到 2030 年,AI 投资将增长约 150%。与此同时,68% 的受访高管担心其 AI 工作将因缺乏与核心业务活动的整合而失败。

同一研究还显示,57% 的受访企业领导者认为其竞争优势将主要源于 AI 模型的尖端性。为此,随着 AI 在商业中发挥的作用持续增强,安全的专用 AI 基础设施已变得至关重要。

AI 学院

利用混合云实现 AI 就绪

本课程由 IBM 资深思想领袖带领,旨在帮助企业领导者获得所需的知识,以便划分可以推动增长的 AI 投资的优先级。

人工智能、机器学习与深度学习

各行各业不同规模的企业都依靠 AI 基础设施来帮助其实现 AI 雄心壮志。在深入研究 AI 基础设施及其工作原理之前,有必要回顾一下几项基础技术:人工智能、机器学习 (ML)深度学习

人工智能 (AI)

AI 是一种允许计算机模拟人类思考和解决问题的技术。当与互联网、传感器和机器人等其他技术相结合时,AI 可执行通常需要人工输入的任务。这些任务包括操作车辆、回答问题或从大量数据中提供洞察分析。

许多 AI 最流行的应用都依赖于机器学习模型,这是一个专门关注数据和算法的 AI 领域。

机器学习 (ML)

ML 是 AI 的一个重点领域,它利用数据和算法来模仿人类的学习方式,并随着时间的推移提高答案的准确性。ML 依赖于几个主要流程:

  • 一个用于做出预测或分类信息的决策流程
  • 一个用于评估其工作准确性的误差函数
  • 一个用于减少已知示例与模型估计值之间差异的模型优化流程

一个 ML 算法,而此算法会重复此“评估并优化”流程,直到达到所定义的模型精度阈值。

深度学习

深度学习是 ML 的一个子集,而它构成了大语言模型 (LLM) 及其他生成式 AI 应用程序的基础。

它由仿照人脑建模的多层神经网络组成。这些算法会通过不断优化用于识别非结构化数据(例如,图像、声音、文本)中复杂模式的方式来进行学习。此能力使深度学习非常适合自然语言处理 (NLP),而 NLP 可驱动聊天机器人、翻译工具和预测分析,以预测客户需求。

要了解更多有关这些技术之间的细微差别,请查看我们的博文“AI、机器学习、深度学习与神经网络:有什么区别?

AI 基础设施与 IT 基础设施

IT 基础设施是一个广义术语,它指企业有效管理和运行其 IT 环境所需的硬件、软件与网络资源。

IT 基础设施和 AI 基础设施都共享现代底层技术,如虚拟化虚拟机管理程序容器、开源 Kubernetes微服务,以用于大规模部署和编排 AI 工作负载。虽然 IT 基础设施由支持一般业务应用程序的技术组成,但 AI 基础设施依赖专门的硬件和软件来运行和训练 AI 模型。

随着企业发现更多使用 AI 的方式,建立必要的基础设施以支持其发展已变得至关重要。无论是部署 ML 以推动供应链创新,还是准备发布生成式 AI 驱动式虚拟代理,拥有正确的基础设施均至关重要。

AI 项目需要定制基础设施的主要原因是运行 AI 工作负载所需的大量电力。为实现此能力,AI 基础设施依赖于低延迟云计算环境。此外,它还依赖于图形处理单元 (GPU) 的处理能力,而非 IT 基础设施环境中典型的传统中央处理单元 (CPU)

此外,AI 基础设施专注于专为支持 AI 与 ML 任务的分布式混合架构而设计的硬件和软件。

AI 基础设施是如何工作的?

AI 基础设施依赖于现代硬件与软件的混合。该集成式堆栈包括可支持整个 AI 生命周期的计算、网络与存储解决方案及其他资源,并涵盖模型训练、部署和持续管理。

高级 AI 基础设施组件的详细介绍如下。

硬件

  • 专业服务器:AI 基础设施使用支持高速数据移动和高性能存储功能的专用服务器和服务器集群。这些硬件涵盖从本地 AI 芯片服务器(例如,搭载 Telum 处理器的 IBM Z)到节能边缘 AI 服务器以及基于云的高密度服务器。
  • 计算资源:ML 与 AI 任务需要大量算力。精心设计的 AI 基础设施通常包括图形处理单元 (GPU) 和张量处理单元 (TPU) 等专用硬件,以提供并行处理能力并加快 ML 任务的速度。
  • 图形处理单元 (GPU):由 NVIDIA 或 Intel 制造的 GPU 是用于训练和运行 AI 模型的电子电路,因为它们具有一次执行多项操作的独特能力。通常,AI 基础设施包括用于加快 AI 任务中常见矩阵与矢量计算的 GPU 服务器。
  • 张量处理单元 (TPU):TPU 是为加快 AI 工作负载中的张量计算而定制构建的 AI 加速器。它们的高吞吐量和低延迟使其成为众多 AI 与深度学习应用的理想选择。
  • 数据存储:AI 应用程序需在大型数据集上进行训练才能实现效果。希望部署 AI 产品和服务的企业需投资于可扩展的数据存储与管理解决方案;例如,内部或基于云的数据库数据仓库、分布式文件系统和数据湖
  • 网络:AI 基础设施整合了 AI 网络系统,而这些系统使用 AI 和 ML 来大规模支持 AI 工作负载,并提高网络智能、性能和安全性。关键组件包括高性能交换机和路由器、互连和计算加速器,以实现低延迟和高带宽的性能。
  • AI 数据中心:AI 数据中心是一种容纳训练、部署和交付 AI 应用程序和服务所需的特定 IT 基础设施的设施。这些数据中心可提供先进的算力、网络与存储系统,以及处理 AI 工作负载所需的能源和冷却能力。

软件

  • 数据预处理和过滤:从多个来源进行数据摄取首先出现在模型训练中。随后,Pandas、Scipy 和 NumPy 一类的数据处理框架和库可处理并清理大规模数据。
  • 机器学习框架和库:ML 框架为 AI 提供了特定资源来设计、训练和部署 ML 模型。ML 框架(如 TensorFlow 和 PyTorch)支持 AI 应用程序所需的各种功能。这些功能包括 GPU 任务的加速以及对三种 ML 训练(监督学习、无监督学习和强化学习)至关重要的功能。此类框架可加快机器学习的过程,并为开发者提供开发和部署 AI 应用程序所需的工具。
  • MLOps 与 AIOps 平台:MLOps(机器学习运维)是一个涉及一系列特定实践的流程,它可帮助实现机器学习的自动化和加速。MLOps 平台可帮助开发者和工程师进行数据收集和模型训练,以及在应用程序启动后进行验证、故障排除和监控。这些平台支撑着 AI 基础设施的功能,从而帮助数据科学家、工程师和其他相关人员成功推出新的 AI 工具、产品和服务。通过应用 AI 和 ML 以智能地自动执行资源部署、扩展、持续监控与可观测性以及为 AI 工作流设计的 CI/CD 管道,AIOps 进一步扩展了 MLOps 流程。
  • 安全工具:AI 基础设施会将 AI 安全工具与现有的网络安全基础设施(如威胁情报源和安全信息与事件管理 (SIEM) 系统相结合。加密和访问控制可帮助组织在整个攻击面上保护其 AI 系统和敏感数据。

什么是 AI 即服务 (AIaaS)?

AI 即服务 (AIaaS) 是指以按需定价提供 AI 工具和功能的服务平台。这款基于云的软件可让用户无需构建自己的 AI 模型即可使用这些功能。

开发团队和其他团队以及其他用户可通过应用程序编程接口 (API) 或软件开发工具包 (SDK) 访问这些工具,而这些API 和 SDK 可将 AI 功能集成到相关团队或用户的应用程序和服务中。例如,AIaaS 可提供自然语言处理工具来分析客户情绪,从而帮助企业改善客户体验,而无需构建模型。

AI 基础设施的优点

除了为客户开发尖端应用程序提供支持外,投资 AI 基础设施的企业通常还能看到其流程和工作流的显著改进。

以下是开发强大 AI 基础设施的企业可以预期的六大最常见优点:

  • 提高了可扩展性和灵活性
  • 更高的性能和速度
  • 更多合作
  • 提升合规性
  • 降低成本
  • 增强的生成式 AI 与智能体式 AI 功能

更高的可扩展性和灵活性

由于 AI 基础设施通常是基于云或部署在边缘的,因此既可扩展又十分灵活。随着驱动 AI 应用程序所需的数据集变得越来越大、越来越复杂,AI 基础设施旨在随之扩展,以便组织能根据需要增加资源。

灵活的云与边缘基础设施具备很高的适应性,且随着企业需求的变化,可比传统 IT 基础设施更易进行扩展或缩减。

更高的性能和速度

AI 基础设施采用可用的最新高性能计算 (HPC) 技术(如 GPU、TPU 和超级计算系统)来为支撑 AI 功能的 ML 算法提供动力。AI 生态系统具有并行处理功能,从而可大大减少训练 ML 模型所需的时间。

由于速度在很多 AI 应用(如高频交易应用程序和无人驾驶汽车)中至关重要,因此提高速度和性能是 AI 基础设施的一项关键特征。

更多合作

强大的 AI 基础设施不仅涉及硬件和软件,还为开发者和工程师提供了在构建 AI 应用程序时更有效地协同工作所需的系统和流程。

依靠 MLOps(一种旨在简化和自动完成 ML 模型创建的 AI 开发生命周期),AI 系统可让工程师更有效地构建、共享和管理他们的 AI 项目。

提升合规性

随着对数据隐私和 AI 的关注与日俱增,监管环境也变得更加复杂,其中包括数据驻留与 AI 主权问题。因此,强大的 AI 基础设施必须确保在开发新 AI 应用程序的数据管理和数据处理过程中严格遵守隐私法。

AI 基础设施解决方案可确保企业严格遵守所有适用的法律和标准,并实现 AI 合规性。它们还能保护用户数据,并防范法律与声誉损害。

降低成本

虽然投资 AI 基础设施可能很昂贵,但尝试在传统 IT 基础设施上开发 AI 应用程序和功能的相关成本却可能更高。通常,此方法不如投资建设专用 AI 基础设施更具成本效益。

AI 基础设施可优化资源,并应用技术来开发和部署 AI 项目。此外,与在过时、低效的 IT 基础设施上实现 AI 计划相比,它还可提供针对这些计划的更高投资回报率 (ROI)。

增强的生成式人工智能与智能体式 AI 功能

生成式 AI 可根据简单的用户提示创建自己的内容(包括文本、图像、视频和计算机代码)。正如 ChatGPTClaude AI 等程序以及从客户支持到投资分析的各种业务用例所示,此能力可提高企业和个人的工作效率。智能体式 AI 则更进一步,它可让 AI 系统自主地规划和执行多步骤任务。

具有围绕生成式与智能体式 AI 的强大框架的 AI 基础设施可帮助企业安全、负责任地开发这些能力。

构建强大 AI 基础设施的六个步骤

以下是各种规模和行业的企业为构建其所需的企业 AI 基础设施可采取的六个步骤。

1. 确定预算和目标

在您调查希望构建和维护有效 AI 基础设施的企业可用的众多选项之前,重要的是要明确说明您需要从中得到什么。

您想解决哪些问题?您愿意投资多少?

明确回答此类问题是一个良好的开端,且有助于简化您在选择工具和资源时的决策过程。

2. 选择合适的硬件和软件

选择适合您需求的正确工具和解决方案是创建您可以依赖的 AI 基础设施的重要步骤。从 GPU 和 TPU 到加快机器学习,再到构成软件堆栈的数据库和 ML 框架,在选择资源时您将面临很多重要选择。

请明确您的目标和您愿意投入的资金,并在此基础上评估各种选项。

3. 找到合适的网络解决方案

快速、可靠的数据流对于 AI 基础设施的功能至关重要。高带宽、低延迟网络(如 5G)支持在存储和处理之间快速安全地移动大量数据。此外,5G 网络提供公共与私有网络实例,以提升隐私性、安全性和可定制性。

如果没有合适的网络,世界上最好的 AI 基础设施工具将毫无用处,无法让它们按照设计的方式运行。

4. 在云和本地部署解决方案之间做出选择

AI 基础设施的组件可在云端、本地和边缘提供,因此在决定最适合自己的方案前,请务必权衡每种方案的优势。

云供应商(如 AWS、Oracle、IBM 和 Microsoft Azure)通过为企业提供即用即付模式,提供了更高的灵活性和可扩展性。本地 AI 基础设施也有其优势,且通常能为特定工作负载提供更多控制力和更高的性能。边缘部署专为需要处理更靠近源的数据以及低延迟的工作负载而设计。

当今很多企业都在所有这些环境中运行 AI。

5. 制定合规措施

AI 和 ML 是受到高度监管的创新领域,且随着越来越多公司在该领域推出应用程序,它正受到越来越密切的关注。

管理该行业的大多数法规都与数据隐私和安全有关,而违反这些法规可能会导致企业遭受破坏性罚款和声誉损害。

认真制定 AI 合规措施,其中包括旨在确保负责任地使用 AI 的法律、法规和内部政策。

6. 实施和维护解决方案

构建 AI 基础设施的最后一步是推出并维护它。您和将使用它的开发者和工程师团队一起,需确保硬件和软件保持最新。此外,您还需确保您已制定的流程得到切实遵循。

此工作通常包括定期更新软件和运行系统诊断程序,以及审查和审计流程和工作流。

Stephanie Susnjara

Staff Writer

IBM Think

Mesh Flinders

Staff Writer

IBM Think

Ian Smalley

Staff Editor

IBM Think

相关解决方案
IBM Storage Fusion

混合云、容器原生平台,为现代 Kubernetes 工作量提供可扩展的存储数据保护和统一管理。

深入了解 IBM Storage Fusion
AI 基础设施解决方案

IBM 提供 AI 基础设施解决方案并通过混合设计战略来加快对整个企业产生的影响。

深入了解 AI 基础设施解决方案
AI 咨询与服务

借助 IBM Consulting 释放企业数据的价值,构建一个可带来业务优势的洞察驱动型组织。

深入了解 AI 咨询服务
采取后续步骤

凭借统一的高性能存储与 AI 就绪型基础设施,为 AI 及混合云工作负载提供支撑,助力实现扩展、自动化与创新加速。

  1. 深入了解 IBM FlashSystem
  2. 深入了解 AI 基础设施解决方案