IBM Granite 3.1: rendimiento potente, contexto más largo, nuevos modelos de integración y mucho más

Ilustración de cubos que representan el cubo de Granite 3.1

Autor

Kate Soule

Director, Technical Product Management, Granite

IBM

Dave Bergmann

Senior Staff Writer, AI Models

IBM Think

Toda la información clave en un solo vistazo:
 

  • .
  • Granite 3.1 8B Instruct ofrece importantes mejoras de rendimiento con respecto a Granite 3.0 8B Instruct. Su puntuación media en las pruebas comparativas de Hugging Face OpenLLM Leaderboard se encuentra ahora entre las más altas de cualquier modelo abierto de su categoría.
  • Hemos ampliado las ventanas contextuales de toda la familia de modelos de lenguaje Granite 3. Nuestros últimos modelos densos (Granite 3.1 8B, Granite 3.1 2B), los modelos MoE (Granite 3.1 3B-A800M, Granite 3.1 1B-A400M) y los modelos de límites de protección (Granite Guardian 3.1 8B, Granite Guardian 3.1 2B) cuentan todos con una longitud de contexto de 128 000 tokens.
  • Vamos a lanzar una familia de modelos de integración totalmente nuevos. Los nuevos modelos de integración Granite optimizados para la recuperación se distribuyen en cuatro tamaños, que oscilan entre los 30 y los 278 millones de parámetros. Al igual que sus homólogos generativos, ofrecen compatibilidad multilingüe en 12 idiomas diferentes: inglés, alemán, español, francés, japonés, portugués, árabe, checo, italiano, coreano, neerlandés y chino.
  • Granite Guardian 3.1 8B y 2B incorporan una nueva función de detección de alucinaciones en las llamadas, que permite un mayor control y observabilidad de los agentes que realizan llamadas a herramientas.
  • Todos los modelos Granite 3.1, Granite Guardian 3.1 y Granite Embedding son de código abierto bajo licencia Apache 2.0.
  • Estas últimas incorporaciones a la serie Granite siguen al reciente lanzamiento por parte de IBM de Docling (un marco de trabajo de código abierto para preparar documentos para RAG y otras aplicaciones de IA generativa) y Bee (un marco de trabajo independiente del modelo y de código abierto para la IA agéntica).
  • Granite TTM (TinyTimeMixers), la serie de modelos de series temporales compactos pero de gran rendimiento de IBM, ya están disponibles en watsonx.ai a través de la versión beta de la API y el SDK de watsonx.ai Timeseries Forecasting.
  • Los modelos Granite 3.1 ya están disponibles en IBM watsonx.ai, así como a través de los partners de la plataforma, entre los que se incluyen (por orden alfabético) Docker, Hugging Face, LM Studio, Ollama y Replicate.
  • Los partners empresariales también aprovecharán Granite 3.1 a nivel interno: Samsung está integrando modelos seleccionados de Granite en su plataforma SDS; Lockheed Martin está integrando modelos de Granite 3.1 en sus herramientas AI Factory, que utilizan más de 10 000 desarrolladores e ingenieros.
.


Hoy se lanza IBM Granite 3.1, la última actualización de nuestra serie Granite de modelos de lenguaje abiertos, de alto rendimiento y optimizados para la empresa. Este conjunto de mejoras, adiciones y nuevas capacidades se centra principalmente en aumentar el rendimiento, la precisión y la responsabilidad en casos de uso empresariales esenciales como el uso de herramientas, la generación aumentada por recuperación (RAG) y los flujos de trabajo escalables de IA agéntica.

Granite 3.1 aprovecha el impulso de la recientemente lanzada colección Granite 3.0. IBM seguirá lanzando modelos actualizados y funcionalidades para la serie Granite 3 en los próximos meses, con nuevas capacidades multimodales previstas para el primer trimestre de 2025.

Estos nuevos modelos Granite no son las únicas contribuciones recientes notables de IBM al ecosistema de LLM de código abierto. El lanzamiento de hoy culmina una reciente racha de lanzamientos innovadores de código abierto, desde un marco flexible para desarrollar agentes de IA hasta un conjunto de herramientas intuitivas para desbloquear información esencial escondida en PDF, presentaciones de diapositivas y otros formatos de archivo difíciles de digerir para los modelos. El uso de estas herramientas y marcos junto con los modelos Granite 3.1 ofrece a los desarrolladores capacidades avanzadas para RAG, agentes de IA y otros flujos de trabajo basados en LLM.

Como siempre, el compromiso histórico de IBM con el código abierto se refleja en las licencias de código abierto permisivas y estándar para cada oferta tratada en este artículo.

Granite 3.1 8B Instruct sube el listón para los modelos empresariales ligeros

Los esfuerzos de IBM en la optimización continua de la serie Granite son más evidentes en el crecimiento de su modelo insignia 8B denso. El IBM Granite 3.1 8B Instruct supera ahora a la mayoría de los modelos abiertos de su categoría en puntuación media en las evaluaciones comparativas académicas incluidas en la Hugging Face OpenLLM Leaderboard.

La evolución de la serie de modelos Granite ha seguido priorizando la excelencia y la eficiencia en los casos de uso empresarial, incluida la IA agéntica. Este progreso es más evidente en el rendimiento significativamente mejorado del modelo 8B más reciente en IFEval, un conjunto de datos con tareas que ponen a prueba la capacidad de un modelo para seguir instrucciones detalladas, y en Multi-step Soft Reasoning (MuSR), cuyas tareas miden el razonamiento y la comprensión de textos largos.

Gráfico que muestra el rendimiento del modelo de lenguaje Comparación del rendimiento del modelo en las pruebas de referencia de Hugging Face OpenLLM Leaderboard.

Longitud del contexto ampliada

El salto de rendimiento de Granite 3.0 a Granite 3.1 se ve reforzado por la ampliación de las ventanas contextuales de todos los modelos. La longitud del contexto de 128 000 tokens de Granite 3.1 está a la par con la de otras series de modelos abiertos líderes, como Llama 3.1-3.3 y Qwen2.5.

La ventana contextual (o longitud del contexto) de un modelo de lenguaje de gran tamaño (LLM) es la cantidad de texto, en tokens, que un LLM puede considerar en un momento dado. Una ventana contextual más grande permite a un modelo procesar entradas más grandes, realizar intercambios continuos más largos e incorporar más información en cada salida. La tokenización no implica ningún "tipo de cambio" fijo entre token y palabra, pero podemos estimar 1,5 token por palabra. 128 000 tokens equivalen aproximadamente a un libro de 300 páginas.

Por encima de un umbral de unos 100 000 tokens, surgen nuevas posibilidades asombrosas, como la respuesta a preguntas de varios documentos, la comprensión de código a nivel de repositorio, la autorreflexión y los agentes autónomos impulsados por LLM.1 La longitud del contexto ampliada de Granite 3.1 se presta así a una gama mucho más amplia de casos de uso empresarial, desde el procesamiento de bases de código y documentos jurídicos extensos en su totalidad hasta la revisión simultánea de miles de transacciones financieras.

Granite Guardian 3.1: detección de alucinaciones en flujos de trabajo agénticos
.

Granite Guardian 3.1 8B y Granite Guardian 3.1 2B pueden detectar ahora las alucinaciones que puedan producirse en un flujo de trabajo agéntico, lo que proporciona la misma responsabilidad y confianza a la llamada a funciones que ya proporcionamos para RAG.

Hay muchos pasos y subprocesos implicados en el espacio entre la petición inicial enviada a un agente de IA y la salida que el agente devuelve finalmente al usuario. Para supervisar todo el proceso, los modelos Granite Guardian 3.1 supervisan cada llamada a una función en busca de alucinaciones sintácticas y semánticas.

Por ejemplo, si un agente de IA consulta supuestamente una fuente de información externa, Granite Guardian 3.1 supervisa si hay flujos de información fabricados. Si un flujo de trabajo agéntico implica cálculos intermedios utilizando cifras recuperadas de un registro bancario, Granite Guardian 3.1 comprueba si el agente extrajo la llamada a la función correcta junto con las cifras adecuadas.

El lanzamiento de hoy es un paso más hacia la responsabilidad y la confianza para cualquier componente de un flujo de trabajo empresarial basado en LLM. Los nuevos modelos Granite Guardian 3.1 están disponibles en Hugging Face. También estarán disponibles a través de Ollama a finales de este mes y en IBM watsonx.ai en enero de 2025.

Modelos de integración de Granite

Las integraciones son una parte esencial del ecosistema LLM. Un medio preciso y eficiente de representar palabras, consultas y documentos en forma numérica es fundamental para una serie de tareas empresariales que incluyen la búsqueda semántica, la búsqueda vectorial y la RAG, así como el mantenimiento de bases de datos vectoriales eficaces. Un modelo de integración eficaz puede mejorar significativamente la comprensión de la intención del usuario por parte de un sistema y aumentar la relevancia de la información y las fuentes en respuesta a una consulta.

Mientras que en los dos últimos años hemos sido testigos de la proliferación de LLM autorregresivos de código abierto cada vez más competitivos para tareas como la generación y el resumen de textos, los lanzamientos de modelos de integración de código abierto de los principales proveedores son relativamente escasos y distantes entre sí.

Los nuevos modelos de integración de Granite son una evolución mejorada de la familia Slate de modelos de lenguaje basados solo en codificador y en RoBERTA. Entrenados con el mismo cuidado y consideración para filtrar sesgos, odio, abusos y blasfemias ("HAP", por sus siglas en inglés) que el resto de la serie Granite, Granite Embedding se ofrece en cuatro tamaños de modelo, dos de los cuales admiten la incrustación multilingüe en 12 idiomas naturales:

  • .
  • Granite-Embedding-30M-Inglés
  • Granite-Embedding-125M-Inglés
  • Granite-Embedding-107M-Multilingüe
  • Granite-Embedding-278M-Multilingüe
.

Mientras que la gran mayoría de los modelos de integración abiertos de la tabla de clasificación MTEB de Hugging Face se basan en conjuntos de datos de entrenamiento cuya licencia solo tiene fines de investigación, como MS-MARCO, IBM verificó la elegibilidad comercial de todas las fuentes de datos empleadas para entrenar Granite Embedding. Como muestra del cuidado puesto en dar soporte al uso empresarial, IBM da soporte a Granite Embedding con la misma indemnización sin tope para reclamaciones de propiedad intelectual de terceros que se proporciona para el uso de otros modelos desarrollados por IBM.

La diligencia de IBM a la hora de seleccionar y filtrar los datos de entrenamiento no impidió que los modelos Granite Embedding en inglés siguieran el ritmo de destacados modelos de integración de código abierto de tamaño similar en las evaluaciones internas de rendimiento realizadas utilizando el marco de evaluación BEIR.

Gráfico comparativo del rendimiento del modelo de integración Comparación del rendimiento medio de los modelos de integración en tareas de recuperación, realizada utilizando el marco de pruebas estándar BEIR.

Las pruebas de IBM también demostraron que dos de los nuevos modelos de integración, Granite-Embedding-30M-Inglés y Granite-Embedding-107M- Mulilingüe, superan significativamente a las ofertas de la competencia en cuanto a velocidad de inferencia.

Gráfico comparativo de la velocidad del modelo de integración Velocidad media de inferencia del modelo en las pruebas internas de IBM en condiciones de implementación idénticas.

Este lanzamiento inicia la ambiciosa hoja de ruta de IBM Research para seguir innovando con la familia de modelos de código abierto Granite Embedding. Las actualizaciones y mejoras previstas para 2025 incluyen la ampliación del contexto, la optimización para RAG y las capacidades de recuperación multimodal.

Descifrado de documentos e IA agéntica

Junto a la continua evolución de la serie Granite, IBM mantiene su firme compromiso con la IA de código abierto mediante el reciente desarrollo y publicación en código abierto de nuevas herramientas y marcos innovadores para desarrollar con LLM. Optimizados para los modelos Granite pero intrínsecamente abiertos e independientes del modelo, estos recursos creados por IBM ayudan a los desarrolladores a aprovechar todo el potencial de los LLM, desde la facilitación de pipelines de ajuste hasta la regularización de fuentes RAG o el ensamblaje de agentes de IA autónomos.

Docling: preparación de documentos para la RAG, preentrenamiento y ajuste
.

Desde la escritura creativa hasta la RAG, la IA generativa es, en última instancia, un motor que funciona con datos. El verdadero potencial de los modelos de lenguaje de gran tamaño no puede aprovecharse si algunos de esos datos están atrapados en formatos que los modelos no pueden reconocer. Los LLM son bastante nuevos, pero el problema no lo es: como proclamaba un titular del Washington Post de hace una década, "las soluciones a todos nuestros problemas pueden estar enterradas en un PDF que nadie lee".

Por eso IBM Deep Search ha desarrollado Docling, una potente herramienta para analizar documentos en formatos populares como PDF, DOCX, imágenes, PPTX, XLSX, HTML y AsciiDoc y convertirlos a formatos aptos para los modelos como Markdown o JSON. Esto permite que modelos como Granite puedan acceder fácilmente a esos documentos, y a la información que contienen, a efectos de RAG y otros flujos de trabajo. Docling permite una fácil integración con marcos agénticos como LlamaIndex, LangChain y Bee, lo que permite a los desarrolladores incorporar su asistencia al ecosistema de su elección.

Docling, de código abierto bajo la licencia permisiva MIT, es una solución sofisticada que va más allá del simple reconocimiento óptico de caracteres (OCR) y la extracción de texto. Como explica William Caban de Red Hat, Docling integra una serie de técnicas de preprocesamiento contextuales y basadas en elementos: si una tabla abarca varias páginas, Docling sabe que debe extraerla como una sola tabla; si una página determinada mezcla cuerpo de texto, imágenes y tablas, cada uno debe extraerse por separado de acuerdo con su contexto original.

El equipo detrás de Docling está trabajando activamente en características adicionales, incluyendo la extracción de ecuaciones y códigos y la extracción de metadatos. Para ver Docling en acción, eche un vistazo a este tutorial para construir un sistema de respuesta a preguntas sobre documentos con Docling y Granite.

Bee: marco de IA agéntica para modelos abiertos

El Marco para agentes de Bee es un marco de código abierto para crear potentes flujos de trabajo de IA agéntica con LLM de código abierto, optimizado para su uso con los modelos Granite y Llama (con otras optimizaciones específicas del modelo ya en desarrollo). Incluye una serie de módulos que permiten a los desarrolladores personalizar casi cualquier componente del agente de IA, desde la gestión de la memoria hasta el uso de herramientas o la gestión de errores, así como múltiples funciones de observabilidad que proporcionan los conocimientos y la responsabilidad necesarios para la implementación en producción.

El marco se integra a la perfección con múltiples modelos y un conjunto de sólidas herramientas listas para usar, como servicios meteorológicos y de búsqueda en internet (o herramientas personalizadas diseñadas en Javascript o Python). La funcionalidad de uso flexible de herramientas de Bee permite flujos de trabajo adaptados a sus circunstancias específicas, tal y como se demuestra en esta fórmula con Granite y Wikipedia que aprovecha las herramientas incorporadas para utilizar de forma más eficaz una ventana contextual limitada.

Los agentes Granite Bee pueden ejecutarse localmente utilizando Ollama o bien aprovechar la inferencia alojada con watsonx.ai.

Forecasting de series temporales en IBM watsonx.ai

Lanzados a principios de este año, los modelos de series temporales TinyTimeMixer (TTM) de Granite son una familia de modelos preentrenados y ligeros basados en una arquitectura novedosa. Los modelos de series temporales de Granite, que abordan el forecasting zero-shot y few-shot para cualquier cosa, desde los datos de sensores IoT hasta los precios del mercado de valores y las demandas de energía, superan a muchos modelos de hasta 10 veces su tamaño, como TimesFM, Moirai y Chronos.2 Desde el 30 de mayo, los modelos de series temporales TTM de Granite se han descargado más de 3,25 millones de veces solo en Hugging Face.

En noviembre, IBM anunció el lanzamiento de la versión beta de la API y el SDK de forecasting de series temporales de watsonx.ai, lo que permite que los modelos de series temporales de Granite estén disponibles en la plataforma integrada de IA de IBM para el desarrollo integral de aplicaciones de IA.

Para obtener más información sobre cómo empezar a utilizar Granite-TTM, consulte las fórmulas del libro de fórmulas de IBM Granite Timeseries, como este cuaderno para utilizar el SDK de watsonx para realizar inferencias de forecasting.

Primeros pasos con Granite 3.1

Los modelos Granite 3.1 ya están disponibles en IBM watsonx.ai. También se puede acceder a ellos a través de los partners de la plataforma, entre los que se incluyen, por orden alfabético, Docker (a través de su catálogo DockerHub GenAI), Hugging Face, LM Studio, Ollama y Replicate. Algunos modelos de Granite 3.1 también estarán disponibles a través de NVIDIA (como NIM Microservices) en enero de 2025.

En el libro de fórmulas Granite Snack Cookbook de GitHub hay disponibles varias guías y fórmulas para trabajar con modelos Granite, desde la orquestación de flujos de trabajo utilizando modelos de lenguaje de Granite en Langchain hasta la implementación de modelos Granite Guardian.

Los desarrolladores también pueden iniciarse en el uso de los modelos Granite en la zona de juegos de modelos Granite o explorando el conjunto de útiles demostraciones y tutoriales en IBM docs, como por ejemplo:

.


Explore los modelos Granite 3.1 →

Diseño 3D de bolas rodando por un circuito

Las últimas noticias + conocimientos de IA 


Descubra ideas y noticias de expertos sobre IA, nube y mucho más en el boletín semanal Think. 

Soluciones relacionadas
IBM watsonx.ai

Entrene, valide, ajuste e implemente IA generativa, modelos fundacionales y capacidades de machine learning con IBM watsonx.ai, un estudio empresarial de nueva generación para desarrolladores de IA. Cree aplicaciones de IA en menos tiempo y con menos datos.

Descubra watsonx.ai
Soluciones de inteligencia artificial

Ponga la IA a trabajar en su negocio con la experiencia líder en IA del sector de IBM y junto a su cartera de soluciones.

Explore las soluciones de IA
Servicios de IA

Reinvente las operaciones y flujos de trabajo críticos añadiendo IA para maximizar las experiencias, la toma de decisiones en tiempo real y el valor empresarial.

Explore los servicios de IA
Dé el siguiente paso

Obtenga acceso único a capacidades que abarcan el ciclo de vida de desarrollo de la IA. Produzca potentes soluciones de IA con interfaces intuitivas, flujos de trabajo y acceso a API y SDK estándar del sector.

  1. Explore watsonx.ai
  2. Solicite una demostración en directo