Elección de un modelo de base en watsonx.ai

Son muchos los factores que hay que tener en cuenta a la hora de elegir un modelo base que utilizar para la inferencia de un proyecto de IA generativa.

Por ejemplo, para una solución que resuma los informes de incidencias de un centro de atención telefónica, es posible que te interese un modelo base con estas características:

  • Obtiene buenos resultados en las pruebas de rendimiento para tareas de resumen
  • Admite grandes cantidades de texto, lo que implica una ventana de contexto de gran longitud
  • Es capaz de interpretar imágenes de artículos dañados, por lo que admite entradas tanto en formato de texto como de imagen

Determine qué factores son los más importantes para usted y su organización.

Una vez que tenga una lista corta de los modelos que mejor se ajustan a sus necesidades, puede probarlos para ver cuáles le devuelven sistemáticamente los resultados que desea.

Modelos básicos que dan soporte a su caso de uso

Para empezar, busque los modelos de base que pueden realizar el tipo de tarea que desea completar.

La siguiente tabla muestra los tipos de tareas que admiten los modelos básicos de IBM watsonx.ai. Una marca de selección (✓) indica que la tarea que se nombra en la cabecera de columna está soportada por el modelo de base. En algunas de las tareas, puedes hacer clic en un enlace para ver un ejemplo de la consigna de la tarea.

Tabla 1a. Soporte de tareas de modelo de base
Modelo Conversación
de la API de chat
Interacción
con herramientas desde la API de chat
Generación aumentada por recuperación (RAG) Ejemplos
ibm-defense-4-0-small
• RAG de Prompt Lab
• RAG de AutoAI
Ejemplo
de llamada a una herramienta • API de chat
ibm-defense-4-0-micro
• RAG de Prompt Lab
• RAG de AutoAI
Ejemplo
de llamada a una herramienta • API de chat
ibm-defense-3-3-8b-instruct
• RAG de Prompt Lab
API de chat
granite-4-h-tiny
• RAG de Prompt Lab
• RAG de AutoAI
Ejemplo
de llamada a una herramienta • API de chat
granite-4-h-small
• RAG de Prompt Lab
• RAG de AutoAI
API de chat
granite-docling-258M
RAG de Prompt Lab
Ejemplo
de chat con imagen• API de chat
granite-3-3-8b-instruct
• RAG de Prompt Lab
• RAG de AutoAI
Preguntas y respuestas
granite-3-2-8b-instruct
RAG de Prompt Lab
API de chat
granite-3-2b-instruct Código
API de chat
granite-3-8b-instruct
• RAG de Prompt Lab
• RAG de AutoAI
Código
API
de chat • Llamadas a herramientas
granite-3b-code-instruct Código
granite-4-1b-speech
granite-8b-code-instruct Código
granite-20b-code-instruct Código
API de chat
granite-20b-code-base-schema-linking Código
granite-20b-code-base-sql-gen Código
granite-34b-code-instruct Código
API de chat
granite-guardian-3-2b
RAG de Prompt Lab
Clasificación
granite-guardian-3-8b
RAG de Prompt Lab
Clasificación
granite-guardian-3-2-5b
RAG de Prompt Lab
Clasificación
API de chat
granite-vision-3-3-2b Ejemplo
de chat con imagen• API de chat
allam-1-13b-instruct Clasificación
Traducción
codestral-2501 Código
codestral-2508 Código
devstral-small-2512
ClasificaciónPreguntas y respuestas•
Resumen
devstral-medium-2507
ClasificaciónPreguntas y respuestas•
Resumen
devstral-medium-2512
ClasificaciónPreguntas y respuestas•
Resumen
gpt-oss-20b
• RAG de Prompt Lab
• RAG de AutoAI
API de chat
gpt-oss-120b
• RAG de Prompt Lab
• RAG de AutoAI
API de chat
llama-4-maverick-17b-128e-instruct-fp8
• RAG de Prompt Lab
• RAG de AutoAI
Diálogo
Chat
API de chat
llama-4-scout-17b-16e-instruct-int4
• RAG de Prompt Lab
• RAG de AutoAI
Diálogo
Chat
API de chat
llama-3-3-70b-instruct
• RAG de Prompt Lab
• RAG de AutoAI
Ejemplo de chat
Ejemplo
de llamada a herramientas • API de chat
llama-3-2-1b-instruct
RAG de Prompt Lab
Código
Cuadro de diálogo
Llamada a herramientas
llama-3-2-3b-instruct
RAG de Prompt Lab
Código
Cuadro de diálogo
Llamada a herramientas
llama-3-2-11b-vision-instruct
RAG de Prompt Lab
Ej emplo
de chat con imagen• API
de chat• Ejemplo de llamada a herramientas
llama-3-2-90b-vision-instruct
RAG de Prompt Lab
Ej emplo
de chat con imagen• API
de chat• Ejemplo de llamada a herramientas
llama-3-1-8b
RAG de Prompt Lab
Diálogo
llama-guard-3-11b-vision
RAG de Prompt Lab
Clasificación
Ejemplo
de chat con imagen • API de chat
llama-3-1-8b-instruct ✓•
RAG de Prompt Lab
• RAG de AutoAI
Diálogo
API de chat
Llamada a herramientas
llama-3-1-70b-instruct ✓•
RAG de Prompt Lab
• RAG de AutoAI
Diálogo
API de chat
Llamada a herramientas
magistral-small-2509
magistral-medium-2509
ministral-3-8B-instruct-2512
ministral-3B-instruct-2512 ✓•
RAG de Prompt Lab
ministral-8b-instruct
Clasificación
Extracción
ResumenTraducción
ministral-14b-instruct-2512
RAG de Prompt Lab
API
de chat • Ejemplo de chat con imagen
mistral-large-2512 ✓•
RAG de Prompt Lab

Clasificación • Extracción
• Resumen
• Código
Traducción
API
de chat • Llamada a herramientas
Chat con ejemplo de imagen
mistral-large-instruct-2411
RAG de Prompt Lab

Clasificación
Extracción
ResumenCódigo
Traducción
mistral-small-3-2-24b-instruct-2506 ✓•
RAG de Prompt Lab
• RAG de AutoAI

API de chatEjemplo de chat con imagen
mistral-small-3-1-24b-instruct-2503 ✓•
RAG de Prompt Lab
• RAG de AutoAI
API de chat
nvidia-nemotron-nano-12b-v2-vl-fp8
nvidia-nemotron-3-nano-30b-a3b-fp8
pixtral-12b
RAG de Prompt Lab

Clas ificación • Extr acción

• Resumen • Ejemplo de chat con imagen
pixtral-large-instruct-2411 Ejemplo de chat con imagen
voxtral-small-24b-2507 ✓•
RAG de Prompt Lab
• RAG de AutoAI
API
de chat •
ClasificaciónExtracción
Generación
Resumen
Traducción
voxtral-mini-2507

 

Modelos de base multimodales

Los modelos base multimodales son capaces de procesar e integrar información procedente de múltiples modalidades o tipos de datos. Estas modalidades pueden incluir texto, imágenes, audio, vídeo y otras formas de estímulos sensoriales.

Los modelos de base multimodales disponibles en watsonx.ai pueden realizar los siguientes tipos de tareas:

Generación de texto a partir de imágenes
Útil para responder a preguntas visuales, interpretar tablas y gráficos, subtitular imágenes y mucho más.
Conversión de audio a texto
Útil para el reconocimiento de voz, la transcripción de contenido hablado, la comprensión de comandos de voz, la generación de notas de reuniones, la asistencia en materia de accesibilidad y mucho más.

En la siguiente tabla se enumeran los modelos base disponibles que admiten modalidades distintas de la entrada y salida de texto.

Tabla 1b. Modelos de base multimodales compatibles
Modelo Modalidades de entrada Modalidades de salida
granite-vision-3-2-2b imagen, texto Texto
llama-4-maverick-17b-128e-instruct-fp8 imagen, texto Texto
llama-3-2-11b-vision-instruct imagen, texto Texto
llama-3-2-90b-vision-instruct imagen, texto Texto
llama-guard-3-11b-vision imagen, texto Texto
ministral-8b-instruct-2512 imagen, texto Texto
ministral-14b-instruct-2512 imagen, texto Texto
mistral-large-2512 imagen, texto Texto
mistral-small-3-2-24b-instruct-2506 imagen, texto Texto
pixtral-12b imagen, texto Texto
voxtral-small-24b-2507 audio, texto Texto

 

Modelos básicos que dan soporte a su idioma

Muchos modelos de fundación funcionan bien sólo en inglés. Pero algunos creadores de modelos incluyen varios idiomas en los conjuntos de datos de entrenamiento previo para ajustar su modelo en tareas en distintos idiomas y para probar el rendimiento de su modelo en varios idiomas. Si tiene previsto crear una solución para un público global o una solución que realice tareas de traducción, busque modelos que se hayan creado teniendo en cuenta el soporte multilingüe.

La tabla siguiente lista los idiomas naturales soportados además del inglés por los modelos de base en watsonx.ai. Para obtener más información sobre los idiomas que están soportados para los modelos de base multilingüe, consulte la tarjeta de modelo para el modelo de base.

Nota:En el Centro de recursos se puede consultar una descripción general de todos los modelos de la fundación.
Tabla 2. Modelos básicos que dan soporte a idiomas naturales distintos del inglés
Modelo Idiomas distintos del inglés
Granite 4.0 (granite-4-h-small, granite-4-h-micro, granite-4-h-tiny ) Alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés y chino. Puedes ajustar estos modelos de « Granite » para idiomas distintos de estos 12
Granite Instruct 3.3 ( granite-3-3-2b-instruct, granite-3-3-8b-instruct ) Alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés y chino. Puedes ajustar estos modelos de « Granite » para idiomas distintos de estos 12.
Granite Vision ( granite-vision-3-3-2b, granite-vision-3-2-2b ) Alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés, chino
IBM Defensa 4.0 Alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés y chino.
allam-1-13b-instruct Árabe
gpt-oss-120b Multilingüe
Llama 4 ( llama-4-maverick-17b-128e-instruct-fp8 ) Árabe, francés, alemán, hindi, indonesio, italiano, portugués, español, tagalo, tailandés y vietnamita.
Llama 3.3 ( llama-3-3-70b-instruct ) alemán, francés, italiano, portugués, hindi, español y tailandés
Llama 3.2 ( llama-3-2-1b-instruct, llama-3-2-3b-instruct. También llama-3-2-11b-vision-instruct, llama-3-2-90b-vision-instruct y llama-guard-3-11b-vision (con campos de entrada solo de texto) Inglés, alemán, francés, italiano, portugués, hindi, español y tailandés
Llama 3.1 ( llama-3-1-8b-instruct, llama-3-1-70b-instruct ) Inglés, alemán, francés, italiano, portugués, hindi, español y tailandés
Ministral 3 ( ministral-3b-instruct-2512, ministral-8b-instruct-2512, ministral-14b-instruct-2512 ) Francés, español, alemán, italiano, portugués, neerlandés, chino, japonés, coreano, árabe y docenas de idiomas más.
ministral-8b-instruct Multilingüe ( Ver ficha del modelo )
mistral-large-2512 Francés, alemán, italiano, español, chino, japonés, coreano, portugués, neerlandés, polaco y docenas de idiomas más.
Mistral Medium ( mistral-medium-2505 , mistral-medium-2508 ) Multilingüe (Ver ficha del modelo)
mistral-small-3-2-24b-instruct-2506 Francés, alemán, griego, hindi, indonesio, italiano, japonés, coreano, malayo, nepalí, polaco, portugués, rumano, ruso, serbio, español, sueco, turco, ucraniano, vietnamita, árabe, bengalí, chino, farsi.
voxtral-small-24b-2507 Español, francés, portugués, hindi, alemán, neerlandés, italiano.

 

Modelos de cimientos que puede ajustar

Puedes realizar experimentos de ajuste que modifiquen los pesos de los parámetros del modelo base subyacente para orientar al modelo a generar resultados optimizados para una tarea concreta.

La siguiente tabla muestra los modelos de base que se pueden ajustar mediante diversos métodos de ajuste fino disponibles en IBM watsonx.ai. Una marca de verificación (✓) indica que el modelo base admite el ajuste fino.

Tabla 3. Modelos base que se pueden ajustar
Nombre de modelo Ajuste completo LoRA ajuste fino QLoRA ajuste fino
allam-1-13b-instruct
granite-3b-code-instruct
granite-8b-code-instruct
granite-20b-code-instruct
granite-3-1-8b-base
llama-3-1-8b
llama-3-1-8b-instruct
llama-3-1-70b
llama-3-1-70b-gptq

Para obtener más información, consulta «Cómo elegir un modelo para ajustar ».

Tipos de modelos e indemnización por IP

Revise la política de indemnización por propiedad intelectual del modelo de fundación que desee utilizar. Algunos proveedores externos de modelos de cimentación le exigen que les exima de responsabilidad por cualquier infracción de la propiedad intelectual que pudiera derivarse del uso de sus modelos de IA.

Los modelos de base desarrollados por IBM que están disponibles en watsonx.ai tienen una protección de propiedad intelectual estándar, similar a la que IBM proporciona para los productos de hardware y software.

IBM amplía su indemnización estándar por propiedad intelectual a los resultados generados por los modelos cubiertos. Modelos cubiertos incluye IBM y algunos modelos básicos de terceros que están disponibles en watsonx.ai. Los modelos cubiertos por terceros se identifican en el cuadro 4.

La siguiente tabla describe los distintos tipos de modelos de fundación y sus políticas de indemnización. Para más información, consulte el material de referencia.

Tabla 4. Detalles de la política de indemnización
Tipo de modelo de cimentación Política de indemnización Modelos fundacionales Detalles Materiales de referencia
IBM Modelo cubierto Indemnización sin límite IBM - IBM Granite
- IBM Pizarra
IBM -modelos base desarrollados que están disponibles en watsonx.ai. Información sobre licencia
Modelo cubierto por terceros Indemnización limitada IBM Modelos comerciales Mistral Modelos de terceros incluidos en la cobertura que están disponibles en watsonx.ai. Información sobre licencia
Producto no-IBM No IBM indemnización Varias Modelos de terceros que están disponibles en watsonx.ai y están sujetos a sus respectivos términos de licencia, incluidas las obligaciones y restricciones asociadas. Consulte la información del modelo.
Modelo personalizado No IBM indemnización Varias Los modelos Foundation que se importan para utilizarlos en watsonx.ai son Contenido del cliente. El cliente es el único responsable de la selección y el uso del modelo y los resultados, así como del cumplimiento de los términos, obligaciones y restricciones de las licencias de terceros.

Para obtener más información sobre las condiciones de licencia de los modelos de terceros, consulta «Modelos básicos de terceros ».

Más consideraciones para elegir un modelo

Cuadro 5. Consideraciones para elegir un modelo de base en IBM watsonx.ai
Atributo de modelo Consideraciones
Longitud de contexto A veces denominada longitud de ventana de contexto, ventana de contextoo longitud máxima de secuencia, la longitud de contexto es el valor máximo permitido para el número de señales en la solicitud de entrada más el número de señales en la salida generada. Cuando se genera una salida con modelos en watsonx.ai, el número de señales en la salida generada está limitado por el parámetro Número máximo de señales.
Afinado Una vez que se ha entrenado previamente un modelo de base, muchos modelos de base se ajustan para tareas específicas, como la clasificación, la extracción de información, el resumen, la respuesta a las instrucciones, la respuesta a las preguntas o la participación en una conversación de diálogo de ida y vuelta. Un modelo que se somete a un ajuste preciso en tareas similares a su uso planificado normalmente lo hace mejor con solicitudes de disparo cero que los modelos que no están ajustados de una forma que se ajuste a su caso de uso. Una forma de mejorar los resultados de un modelo ajustado es estructurar la solicitud en el mismo formato que las solicitudes de los conjuntos de datos que se han utilizado para ajustar dicho modelo.
Instrucción ajustada Instrucción ajustada significa que el modelo se ha ajustado con solicitudes que incluyen una instrucción. Cuando se ajusta una instrucción de un modelo, normalmente responde bien a las solicitudes que tienen una instrucción incluso si esas solicitudes no tienen ejemplos.
Indemnización IP Además de los términos de licencia, revise la política de indemnización de propiedad intelectual para el modelo. Para más información, consulte Tipos de modelo e indemnización por IP.
Licencia En general, cada modelo de base viene con una licencia diferente que limita cómo se puede utilizar el modelo. Revise las licencias de modelo para asegurarse de que puede utilizar un modelo para la solución planificada.
Arquitectura de modelo La arquitectura del modelo influye en cómo se comporta el modelo. Un modelo basado en transformador normalmente tiene una de las arquitecturas siguientes:
Sólo codificador: Comprende el texto de entrada a nivel de frase transformando las secuencias de entrada en vectores representativos denominados incorporaciones. Las tareas comunes para los modelos sólo de codificador incluyen la clasificación y la extracción de entidades.
Sólo decodificador: genera texto de salida palabra por palabra por inferencia de la secuencia de entrada. Las tareas comunes para los modelos de sólo decodificador incluyen la generación de texto y la respuesta a preguntas.
Codificador-decodificador: ambos entienden el texto de entrada y generan texto de salida basado en el texto de entrada. Las tareas comunes para los modelos de codificador-descodificador incluyen la traducción y el resumen.
Lenguajes de programación soportados No todos los modelos de base funcionan bien para programar casos de uso. Si tiene previsto crear una solución que resuma, convierta, genere o de otro modo procese código, revise qué lenguajes de programación se incluyeron en los conjuntos de datos de preentrenamiento de un modelo y las actividades de ajuste para determinar si ese modelo es adecuado para su caso de uso.

Más información