模型网关
您可以通过模型网关安全地访问并与多个模型提供商的基础模型进行交互。 该模型网关提供了一个 OpenAI-compatible API,用于将来自不同模型供应商的请求路由至基础模型。
使用模型网关通过统一接口路由和格式化请求,实现多个模型提供商之间的高效切换。 您可以通过网关模型构建并部署AI代理、RAG模式等功能。
该模型网关已通过认证,可访问以下基础模型提供商的模型:
- Anthropic
- AWS Bedrock
- Azure OpenAI
- Cerebras
- Cohere
- Google Gemini
- Groq
- 米斯特拉尔
- NVIDIA NIM
- 奥拉马
- OpenAI
- IBM watsonx.ai
- xAI
功能
您可以使用具有以下功能的模型网关:
- 安全管理接入提供商
- 集成 vault IBMSoftware Hub 以使用密钥库,在加密环境中安全存储和管理 API 密钥及其他敏感配置数据。 使用该密钥的连接无法直接访问密钥中的信息。
- 访问多种模式提供商
- 通过单一、统一的界面连接各种模型提供商。 通过 OpenAI-compatible API 端点,您可以使用一致的请求格式与不同的模型进行交互。 访问多个提供商可根据用例灵活集成模型,并加快测试和部署,而无需更改现有代码库。
- 自定义模型端点
- 通过模型网关配置端点,部署并管理您亲自精选的一组基础模型。 自定义端点可将自定义模型安全、可扩展地集成到您的应用程序中。
- 负载均衡
- 使用负载均衡器,可在多个模型后端之间确保高可用性,分发流量,并在扩展后端容量的同时调用单个稳定的别名。
- 速率限制
- 设置基于请求和基于令牌的限制,以防止资源密集型工作负载消耗共享容量,并确保各提供商之间的资源分配公平。
- 访问策略
- 使用访问策略来控制对模型和负载均衡器的访问(通过用户界面),以及对提供商端点、租户端点和策略端点的访问(通过 API)。
要打开模型网关,请打开导航菜单,点击 “管理 ”,然后选择 “模型网关 ”。
工作方式
您可以通过多种方法来配置模型网关。 有关详细信息,请参阅 “设置模型网关 ”。
要通过网关推断基础模型,可采用以下方法:
- watsonx.ai REST API
- OpenAI Python SDK。
详情请参阅通过模型网关进行模型推理。
工作流程
下图展示了通过网关配置模型网关及推理模型的工作流程:
以下是设置和使用模型网关所需步骤的高级概述:
在 IBM Software Hub 密钥库中创建一个密钥,用于安全地存储 API 密钥、模型提供商凭据和配置信息
使用存储在保险库中的凭据,通过模型网关配置模型提供商
为每个已配置的模型提供商添加模型
启用负载均衡、创建访问策略并为模型设置速率限制
可通过网关访问的推理基础模型