Hoy se lanza IBM Granite 3.1, la última actualización de nuestra serie Granite de modelos de lenguaje abiertos, de alto rendimiento y optimizados para la empresa. Este conjunto de mejoras, adiciones y nuevas capacidades se centra principalmente en aumentar el rendimiento, la precisión y la responsabilidad en casos de uso empresariales esenciales como el uso de herramientas, la generación aumentada por recuperación (RAG) y los flujos de trabajo escalables de IA agéntica.
Granite 3.1 aprovecha el impulso de la recientemente lanzada colección Granite 3.0. IBM seguirá lanzando modelos actualizados y funcionalidades para la serie Granite 3 en los próximos meses, con nuevas capacidades multimodales previstas para el primer trimestre de 2025.
Estos nuevos modelos Granite no son las únicas contribuciones recientes notables de IBM al ecosistema de LLM de código abierto. El lanzamiento de hoy culmina una reciente racha de lanzamientos innovadores de código abierto, desde un marco flexible para desarrollar agentes de IA hasta un conjunto de herramientas intuitivas para desbloquear información esencial escondida en PDF, presentaciones de diapositivas y otros formatos de archivo difíciles de digerir para los modelos. El uso de estas herramientas y marcos junto con los modelos Granite 3.1 ofrece a los desarrolladores capacidades avanzadas para RAG, agentes de IA y otros flujos de trabajo basados en LLM.
Como siempre, el compromiso histórico de IBM con el código abierto se refleja en las licencias de código abierto permisivas y estándar para cada oferta tratada en este artículo.
Los esfuerzos de IBM en la optimización continua de la serie Granite son más evidentes en el crecimiento de su modelo insignia 8B denso. El IBM Granite 3.1 8B Instruct supera ahora a la mayoría de los modelos abiertos de su categoría en puntuación media en las evaluaciones comparativas académicas incluidas en la Hugging Face OpenLLM Leaderboard.
La evolución de la serie de modelos Granite ha seguido priorizando la excelencia y la eficiencia en los casos de uso empresarial, incluida la IA agéntica. Este progreso es más evidente en el rendimiento significativamente mejorado del modelo 8B más reciente en IFEval, un conjunto de datos con tareas que ponen a prueba la capacidad de un modelo para seguir instrucciones detalladas, y en Multi-step Soft Reasoning (MuSR), cuyas tareas miden el razonamiento y la comprensión de textos largos.
El salto de rendimiento de Granite 3.0 a Granite 3.1 se ve reforzado por la ampliación de las ventanas contextuales de todos los modelos. La longitud del contexto de 128 000 tokens de Granite 3.1 está a la par con la de otras series de modelos abiertos líderes, como Llama 3.1-3.3 y Qwen2.5.
La ventana contextual (o longitud del contexto) de un modelo de lenguaje de gran tamaño (LLM) es la cantidad de texto, en tokens, que un LLM puede considerar en un momento dado. Una ventana contextual más grande permite a un modelo procesar entradas más grandes, realizar intercambios continuos más largos e incorporar más información en cada salida. La tokenización no implica ningún "tipo de cambio" fijo entre token y palabra, pero podemos estimar 1,5 token por palabra. 128 000 tokens equivalen aproximadamente a un libro de 300 páginas.
Por encima de un umbral de unos 100 000 tokens, surgen nuevas posibilidades asombrosas, como la respuesta a preguntas de varios documentos, la comprensión de código a nivel de repositorio, la autorreflexión y los agentes autónomos impulsados por LLM.1 La longitud del contexto ampliada de Granite 3.1 se presta así a una gama mucho más amplia de casos de uso empresarial, desde el procesamiento de bases de código y documentos jurídicos extensos en su totalidad hasta la revisión simultánea de miles de transacciones financieras.
Granite Guardian 3.1 8B y Granite Guardian 3.1 2B pueden detectar ahora las alucinaciones que puedan producirse en un flujo de trabajo agéntico, lo que proporciona la misma responsabilidad y confianza a la llamada a funciones que ya proporcionamos para RAG.
Hay muchos pasos y subprocesos implicados en el espacio entre la petición inicial enviada a un agente de IA y la salida que el agente devuelve finalmente al usuario. Para supervisar todo el proceso, los modelos Granite Guardian 3.1 supervisan cada llamada a una función en busca de alucinaciones sintácticas y semánticas.
Por ejemplo, si un agente de IA consulta supuestamente una fuente de información externa, Granite Guardian 3.1 supervisa si hay flujos de información fabricados. Si un flujo de trabajo agéntico implica cálculos intermedios utilizando cifras recuperadas de un registro bancario, Granite Guardian 3.1 comprueba si el agente extrajo la llamada a la función correcta junto con las cifras adecuadas.
El lanzamiento de hoy es un paso más hacia la responsabilidad y la confianza para cualquier componente de un flujo de trabajo empresarial basado en LLM. Los nuevos modelos Granite Guardian 3.1 están disponibles en Hugging Face. También estarán disponibles a través de Ollama a finales de este mes y en IBM watsonx.ai en enero de 2025.
Las integraciones son una parte esencial del ecosistema LLM. Un medio preciso y eficiente de representar palabras, consultas y documentos en forma numérica es fundamental para una serie de tareas empresariales que incluyen la búsqueda semántica, la búsqueda vectorial y la RAG, así como el mantenimiento de bases de datos vectoriales eficaces. Un modelo de integración eficaz puede mejorar significativamente la comprensión de la intención del usuario por parte de un sistema y aumentar la relevancia de la información y las fuentes en respuesta a una consulta.
Mientras que en los dos últimos años hemos sido testigos de la proliferación de LLM autorregresivos de código abierto cada vez más competitivos para tareas como la generación y el resumen de textos, los lanzamientos de modelos de integración de código abierto de los principales proveedores son relativamente escasos y distantes entre sí.
Los nuevos modelos de integración de Granite son una evolución mejorada de la familia Slate de modelos de lenguaje basados solo en codificador y en RoBERTA. Entrenados con el mismo cuidado y consideración para filtrar sesgos, odio, abusos y blasfemias ("HAP", por sus siglas en inglés) que el resto de la serie Granite, Granite Embedding se ofrece en cuatro tamaños de modelo, dos de los cuales admiten la incrustación multilingüe en 12 idiomas naturales:
Mientras que la gran mayoría de los modelos de integración abiertos de la tabla de clasificación MTEB de Hugging Face se basan en conjuntos de datos de entrenamiento cuya licencia solo tiene fines de investigación, como MS-MARCO, IBM verificó la elegibilidad comercial de todas las fuentes de datos empleadas para entrenar Granite Embedding. Como muestra del cuidado puesto en dar soporte al uso empresarial, IBM da soporte a Granite Embedding con la misma indemnización sin tope para reclamaciones de propiedad intelectual de terceros que se proporciona para el uso de otros modelos desarrollados por IBM.
La diligencia de IBM a la hora de seleccionar y filtrar los datos de entrenamiento no impidió que los modelos Granite Embedding en inglés siguieran el ritmo de destacados modelos de integración de código abierto de tamaño similar en las evaluaciones internas de rendimiento realizadas utilizando el marco de evaluación BEIR.
Las pruebas de IBM también demostraron que dos de los nuevos modelos de integración, Granite-Embedding-30M-Inglés y Granite-Embedding-107M- Mulilingüe, superan significativamente a las ofertas de la competencia en cuanto a velocidad de inferencia.
Este lanzamiento inicia la ambiciosa hoja de ruta de IBM Research para seguir innovando con la familia de modelos de código abierto Granite Embedding. Las actualizaciones y mejoras previstas para 2025 incluyen la ampliación del contexto, la optimización para RAG y las capacidades de recuperación multimodal.
Junto a la continua evolución de la serie Granite, IBM mantiene su firme compromiso con la IA de código abierto mediante el reciente desarrollo y publicación en código abierto de nuevas herramientas y marcos innovadores para desarrollar con LLM. Optimizados para los modelos Granite pero intrínsecamente abiertos e independientes del modelo, estos recursos creados por IBM ayudan a los desarrolladores a aprovechar todo el potencial de los LLM, desde la facilitación de pipelines de ajuste hasta la regularización de fuentes RAG o el ensamblaje de agentes de IA autónomos.
Desde la escritura creativa hasta la RAG, la IA generativa es, en última instancia, un motor que funciona con datos. El verdadero potencial de los modelos de lenguaje de gran tamaño no puede aprovecharse si algunos de esos datos están atrapados en formatos que los modelos no pueden reconocer. Los LLM son bastante nuevos, pero el problema no lo es: como proclamaba un titular del Washington Post de hace una década, "las soluciones a todos nuestros problemas pueden estar enterradas en un PDF que nadie lee".
Por eso IBM Deep Search ha desarrollado Docling, una potente herramienta para analizar documentos en formatos populares como PDF, DOCX, imágenes, PPTX, XLSX, HTML y AsciiDoc y convertirlos a formatos aptos para los modelos como Markdown o JSON. Esto permite que modelos como Granite puedan acceder fácilmente a esos documentos, y a la información que contienen, a efectos de RAG y otros flujos de trabajo. Docling permite una fácil integración con marcos agénticos como LlamaIndex, LangChain y Bee, lo que permite a los desarrolladores incorporar su asistencia al ecosistema de su elección.
Docling, de código abierto bajo la licencia permisiva MIT, es una solución sofisticada que va más allá del simple reconocimiento óptico de caracteres (OCR) y la extracción de texto. Como explica William Caban de Red Hat, Docling integra una serie de técnicas de preprocesamiento contextuales y basadas en elementos: si una tabla abarca varias páginas, Docling sabe que debe extraerla como una sola tabla; si una página determinada mezcla cuerpo de texto, imágenes y tablas, cada uno debe extraerse por separado de acuerdo con su contexto original.
El equipo detrás de Docling está trabajando activamente en características adicionales, incluyendo la extracción de ecuaciones y códigos y la extracción de metadatos. Para ver Docling en acción, eche un vistazo a este tutorial para construir un sistema de respuesta a preguntas sobre documentos con Docling y Granite.
El Marco para agentes de Bee es un marco de código abierto para crear potentes flujos de trabajo de IA agéntica con LLM de código abierto, optimizado para su uso con los modelos Granite y Llama (con otras optimizaciones específicas del modelo ya en desarrollo). Incluye una serie de módulos que permiten a los desarrolladores personalizar casi cualquier componente del agente de IA, desde la gestión de la memoria hasta el uso de herramientas o la gestión de errores, así como múltiples funciones de observabilidad que proporcionan los conocimientos y la responsabilidad necesarios para la implementación en producción.
El marco se integra a la perfección con múltiples modelos y un conjunto de sólidas herramientas listas para usar, como servicios meteorológicos y de búsqueda en internet (o herramientas personalizadas diseñadas en Javascript o Python). La funcionalidad de uso flexible de herramientas de Bee permite flujos de trabajo adaptados a sus circunstancias específicas, tal y como se demuestra en esta fórmula con Granite y Wikipedia que aprovecha las herramientas incorporadas para utilizar de forma más eficaz una ventana contextual limitada.
Los agentes Granite Bee pueden ejecutarse localmente utilizando Ollama o bien aprovechar la inferencia alojada con watsonx.ai.
Lanzados a principios de este año, los modelos de series temporales TinyTimeMixer (TTM) de Granite son una familia de modelos preentrenados y ligeros basados en una arquitectura novedosa. Los modelos de series temporales de Granite, que abordan el forecasting zero-shot y few-shot para cualquier cosa, desde los datos de sensores IoT hasta los precios del mercado de valores y las demandas de energía, superan a muchos modelos de hasta 10 veces su tamaño, como TimesFM, Moirai y Chronos.2 Desde el 30 de mayo, los modelos de series temporales TTM de Granite se han descargado más de 3,25 millones de veces solo en Hugging Face.
En noviembre, IBM anunció el lanzamiento de la versión beta de la API y el SDK de forecasting de series temporales de watsonx.ai, lo que permite que los modelos de series temporales de Granite estén disponibles en la plataforma integrada de IA de IBM para el desarrollo integral de aplicaciones de IA.
Para obtener más información sobre cómo empezar a utilizar Granite-TTM, consulte las fórmulas del libro de fórmulas de IBM Granite Timeseries, como este cuaderno para utilizar el SDK de watsonx para realizar inferencias de forecasting.
Los modelos Granite 3.1 ya están disponibles en IBM watsonx.ai. También se puede acceder a ellos a través de los partners de la plataforma, entre los que se incluyen, por orden alfabético, Docker (a través de su catálogo DockerHub GenAI), Hugging Face, LM Studio, Ollama y Replicate. Algunos modelos de Granite 3.1 también estarán disponibles a través de NVIDIA (como NIM Microservices) en enero de 2025.
En el libro de fórmulas Granite Snack Cookbook de GitHub hay disponibles varias guías y fórmulas para trabajar con modelos Granite, desde la orquestación de flujos de trabajo utilizando modelos de lenguaje de Granite en Langchain hasta la implementación de modelos Granite Guardian.
Los desarrolladores también pueden iniciarse en el uso de los modelos Granite en la zona de juegos de modelos Granite o explorando el conjunto de útiles demostraciones y tutoriales en IBM docs, como por ejemplo:
1. "Data Engineering for Scaling Language Models to 128K Context," arXiv, 15 de febrero de 2024
2. "Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series," arXiv, 7 de noviembre de 2024
Entrene, valide, ajuste e implemente IA generativa, modelos fundacionales y capacidades de machine learning con IBM watsonx.ai, un estudio empresarial de nueva generación para desarrolladores de IA. Cree aplicaciones de IA en menos tiempo y con menos datos.
Ponga la IA a trabajar en su negocio con la experiencia líder en IA del sector de IBM y junto a su cartera de soluciones.
Reinvente las operaciones y flujos de trabajo críticos añadiendo IA para maximizar las experiencias, la toma de decisiones en tiempo real y el valor empresarial.