Las últimas tendencias en IA, presentadas por expertos
Obtenga conocimientos organizados sobre las noticias más importantes e intrigantes de la IA. Suscríbase a nuestro boletín semanal Think. Consulte la Declaración de privacidad de IBM.
Un modelo de razonamiento, también denominado modelo de pensamiento o modo de razonamiento grande(LRM), es un modelo de lenguaje de gran tamaño (LLM) que se ha ajustado con precisión para resolver problemas en varios pasos mediante la generación de pasos intermedios, a menudo denominados "rastros de razonamiento", mediante los que refina su output de forma iterativa antes de generar su respuesta final.
Entrenados para emplear un razonamiento sofisticado en cadena de pensamiento y otras estrategias de toma de decisiones de varios pasos, los modelos de razonamiento representan la edge del rendimiento del LLM, especialmente en matemáticas, codificación y otros dominios impulsados por el razonamiento lógico. Inicialmente concebidos como una categoría de modelo especializada y distinta, estos "modelos de pensamiento" se han vuelto cada vez más comunes: hoy en día, la mayoría de los modelos de aprendizaje de derecho modernos ofrecen un "modo de pensamiento" o capacidades de razonamiento con nombres similares.
El concepto de "modelo de razonamiento" se introdujo por primera vez en la vista previa del o1 (y el o1-mini) de OpenAI en septiembre de 2024, seguido de "Qwen with Questions" (vista previa del QWQ-32B) de Alibaba en noviembre y el experimento flash Gemini 2.0 de Google en diciembre. Un hito en el desarrollo de los LLM de razonamiento fue la publicación en enero de 2025 del modelo DeepSeek-R1 de código abierto. Mientras que los procesos de entrenamiento utilizados para afinar modelos de razonamiento previos habían sido secretos muy bien guardados, DeepSeek publicó un documento técnico detallado que proporcionó un plan para otros desarrolladores de modelos. IBM® Granite, Anthropic y Mistral AI, entre otros, han lanzado desde entonces sus propios LLM de razonamiento.
En pocas palabras, los LLM de razonamiento están entrenados para dedicar más tiempo a "pensar" antes de responder. Se ha demostrado empíricamente que la adición de este "proceso de razonamiento" produce importantes avances en el rendimiento de LLM en tareas de razonamiento complejas. Este éxito ha ampliado los casos de uso y los dominios del mundo real a los que se pueden aplicar los modelos de IA, lo que marca un importante punto de inflexión en el desarrollo continuo de la IA generativa y los agentes de IA.
Sin embargo, cabe destacar que términos antropomórficos como el "proceso de pensamiento" de un modelo son más convenientes que literales. Como todos los modelos de machine learning, los modelos de razonamiento consisten, en última instancia, en aplicar algoritmos sofisticados para hacer predicciones (por ejemplo, qué palabra debe venir después) que reflejen los patrones aprendidos de los datos de entrenamiento. Los LLM de razonamiento no han demostrado conciencia ni otros signos de inteligencia artificial general (AGI). Un artículo de investigación ampliamente citado de Apple presentado en NeurIPS 2025 pone en duda si las capacidades actuales de razonamiento de modelos pueden escalar a un razonamiento verdaderamente "generalizable".
Quizás sea más exacto decir que los LLM de razonamiento están entrenados para "mostrar su trabajo" generando una secuencia de tokens (palabras) que se asemeja a un proceso de pensamiento humano, y que este acto de "verbalizar" los pensamientos parece desbloquear capacidades de razonamiento latentes que los LLM aprenden implícitamente de su corpus masivo de datos de entrenamiento (que contiene ejemplos de individuos que articulan directa e indirectamente sus propios procesos).
Obtenga conocimientos organizados sobre las noticias más importantes e intrigantes de la IA. Suscríbase a nuestro boletín semanal Think. Consulte la Declaración de privacidad de IBM.
Agregar un "proceso de pensamiento" a los resultados del modelo mitiga muchos de los defectos inherentes de la inferencia LLM estándar al ayudar al modelo a evitar atajos cognitivos dañinos y aflorar conocimientos potencialmente más relevantes que aprendió de los datos de entrenamiento.
En el contexto de los LLM de razonamiento, la literatura de investigación sobre la IA suele hacer referencia al pensamiento del"Sistema 1 " y al" Sistema 2 ", términos acuñados por el economista conductual Daniel Kahneman, ganador del Premio Nobel, en su seminal Pensar, rápido y lento. El pensamiento del Sistema 1 es rápido, inconsciente e intuitivo, se basa en la heurística y requiere poco o ningún esfuerzo. El pensamiento del sistema 2 es lento, deliberado y lógico, y requiere un esfuerzo concertado. Las investigaciones han demostrado consistentemente que los LLM autorregresivos se inclinan, por defecto, por el pensamiento del Sistema 1.
Para algunas tareas, el pensamiento del Sistema 1 es eficaz y computacionalmente eficiente. Pero para muchos otros, el pensamiento impulsivo del Sistema 1 no funciona. Por ejemplo, un artículo de 2023 de los investigadores de Meta Jason Weston y Sainbayar Sukhbaatar señaló cómo los LLM se dejan influenciar fácilmente por la presencia de contexto irrelevante o detalles subjetivos en la instrucción de entrada.
Propusieron una clase de técnicas que denominaron "Atención del Sistema 2" (S2A), en las que se instruye al modelo para que primero genere una versión reescrita de la instrucción despojada de contexto irrelevante y luego responda a esa instrucción reescrita. En los experimentos, S2A superó la inferencia estándar en una variedad de tareas, aumentando la precisión y disminuyendo el servilismo.
Conceptualmente hablando, el objetivo implícito de los enfoques de razonamiento podría entenderse como la implementación de un comportamiento del modelo similar al del Sistema 2 que explora, evalúa y refina sus posibles resultados.
La base para los "modelos de pensamiento" modernos se estableció con los primeros artículos de investigación de los LLM: uno escrito por Google Research en 2021 y otro por investigadores de la Universidad de Tokio en 2022. Ambos demostraron que simplemente añadir la frase “think step by step” – una técnica llamada incitación por cadena de pensamiento— mejora significativamente los output del modelo. Un artículo de 2024 de Google DeepMind hizo una afirmación aún más amplia al proponer una nueva ley de escalado: ampliar la computación en tiempo de prueba (los Recursos utilizados para generar una salida) aumenta el rendimiento del modelo tanto como ampliar la computación en tiempo de entrenar (los Recursos utilizados para entrenar un modelo). El prompting CoT es simplemente una de las muchas técnicas de escalado de inferencia (también llamado escalado en tiempo de prueba), al igual que S2A.
Razonamiento moderno: los LLM van más allá: en lugar de confiar en Prompt Engineering, utilizan técnicas novedosas de ajuste y flujos de trabajo sofisticados para aumentar intrínsecamentela cantidad de cálculo que utiliza el modelo en el momento de la inferencia. La optimización de un modelo de razonamiento implica tanto el desafío técnico de desarrollar algoritmos y datos de entrenamiento como el desafío filosófico de diseñar un "proceso de pensamiento" ideal.
Las etapas iniciales de los LLM de razonamiento de entrenamiento son similares a las de los LLM convencionales. Al igual que los LLM estándar, los modelos de razonamiento obtienen su capacidad lingüística general y su conocimiento del mundo a partir de un preentrenamiento autosupervisado a gran escala, seguido de una cierta cantidad de supervisado para adaptarlo a tareas posteriores (como el uso de chatbots conversacionales). La innovación central es la aplicación de técnicas de aprendizaje por refuerzo (RL) que incentivan al modelo a generar pasos de razonamiento intermedios en el momento de la inferencia antes de producir un resultado.
Años de investigación y experimentación han dado lugar a una serie de enfoques de razonamiento en expansión exponencial, pero todos comparten el objetivo fundamental de aumentar el cálculo del tiempo de prueba. Aparte del LLM básico (o ajustado a las instrucciones) que les sirve de base, los modelos de razonamiento se diferencian por las estrategias específicas de toma de decisiones que están entrenados para emplear y los algoritmos específicos utilizados para incentivar ese comportamiento.
En términos generales, existen dos métodos principales para aumentar el cálculo utilizado en el momento de la inferencia. El objetivo de afinar un modelo de razonamiento es entrenarlo para emplear uno (o ambos) de estos enfoques amplios a través de varios algoritmos de aprendizaje.
La naturaleza de los paradigmas de aprendizaje que producen modelos de razonamiento suele implicar el entrenamiento y la evaluación de problemas cuyas soluciones son de naturaleza verificable, como tareas de codificación o problemas matemáticos. Por lo tanto, las métricas de referencia utilizadas para evaluar el rendimiento del modelo de razonamiento suelen centrarse en esos dominios. Se han realizado muchas menos investigaciones sobre el impacto del razonamiento en dominios más subjetivos, como la escritura creativa.
Para el auge de los LLM de razonamiento ha sido fundamental el avance del fine-tuning basado en RL, que comprende tanto el RL basado en reglas como el RL basado en el deep learning ("RL profundo") en contextos de LLM. Mientras que el aprendizaje supervisado y autosupervisado requiere tareas de entrenamiento estáticas y bien definidas, el RL se adapta bien al tipo de tareas dinámicas, abiertas y complejas para las que el razonamiento de varios pasos es más útil.
El uso de RL para afinar los LLM de una manera que imparta cualidades abstractas no es exclusivo de los modelos de razonamiento. Por ejemplo, la canalización de entrenamiento estándar para un LLM que se utilizará en la configuración de chatbot es la siguiente:
Los LLM de razonamiento suelen pasar por esas mismas etapas de formación, con la adición (en algún momento) de una etapa de aprendizaje por refuerzo que inculca un proceso de razonamiento productivo basado en CoT. Esto se logra definiendo los objetivos de este proceso de razonamiento, los comportamientos específicos del modelo que se "recompensarán", como generar rastros de razonamiento CoT antes de un resultado, y luego optimizando los pesos del modelo de una manera que maximice la recompensa.
Como es difícil o incluso imposible diseñar una función de recompensa explícita para una tarea tan abstracta y compleja como un proceso de razonamiento que sea eficaz para la resolución de todos los problemas complejos, esta señal de recompensa a menudo proviene de un modelo de recompensa separado utilizado durante el entrenamiento. En RLHF, este modelo de recompensa se entrena con comentarios humanos y aprende a predecir una puntuación numérica de cuánto preferiría un humano una respuesta determinada.
En el contexto de RL para modelos de razonamiento, las señales de recompensa se pueden dividir en tres categorías amplias: modelos de recompensa de resultados (ORM), modelos de recompensa de procesos (PRM) y sistemas de recompensa basados en reglas.
Los modelos de recompensa por resultados (ORM), como su nombre indica, Verify la precisión del output final del modelo de razonamiento y proporcionan señales de recompensa que se utilizan para optimizar las ponderaciones del modelo en consecuencia. Esto es superficialmente similar al papel de una función de pérdida en el aprendizaje supervisado, aunque la mecánica suele ser más compleja.
Mientras que una función de pérdida suele medir la divergencia token por token entre el resultado de un modelo y la verdad fundamental, un ORM eficaz debe ser capaz de reconocer la respuesta correcta a un problema matemático incluso cuando se presenta de forma muy diferente a la respuesta de la verdad fundamental disponible, lo que suele ocurrir dada la alta variabilidad de los resultados largos de CoT. Del mismo modo, la mayoría de los problemas de codificación del mundo real tienen múltiples soluciones: la evaluación holística del resultado del código suele requerir una canalización de datos que ejecute y verifique eficazmente la eficacia de los fragmentos de código. Otras cualidades de resultado, como si sigue el formato o las instrucciones prescritos, pueden utilizar un LLM estándar como verificador.
Si bien los ORM son una solución relativamente sencilla y computacionalmente eficiente, pueden recompensar potencialmente situaciones en las que los pasos de razonamiento defectuosos conducen, sin embargo, a una respuesta final correcta, lo que da como resultado que el modelo aprenda procesos de razonamiento subóptimos.
Los modelos de recompensa por procesos (PRM) califican y recompensan (o penalizan) cada paso de razonamiento individual de forma aislada, en lugar de centrarse únicamente en la precisión de la respuesta final. Esto proporciona señales de recompensa más detalladas y ajustes posteriores del modelo, lo que produce modelos con un proceso de razonamiento más sólido e interpretable.
Sin embargo, los PRM son más costosos y lentos de entrenar e implementar. Los primeros enfoques influyentes de las PRM, como el conjunto de datos PRM800K de OpenAI, se basaron casi por completo en el laborioso etiquetado de datos realizado por anotadores humanos. Muchos enfoques posteriores, como el influyente Math-Shepherd, han automatizado este proceso inferiendo la validez de un paso de razonamiento en función de la frecuencia con la que resulta en una respuesta correcta.
Para evitar los costes y las complicaciones de los modelos de recompensa, algunos enfoques de ajuste fino basados en RL diseñan tareas de entrenamiento de forma que simplifican el acto de evaluar las salidas del modelo.
Por ejemplo, las técnicas DeepSeek-R1 y R1-Zero dan instrucciones a los modelos para que formateen sus respuestas finales dentro de una caja separada, permitiendo verificar la precisión sin necesidad de un modelo de recompensa especializado que deba analizar toda la respuesta. Otros sistemas de recompensa basados en reglas incentivan microacciones específicas, como añadir periódicamente "espera" a la respuesta del modelo para fomentar una mayor exploración y autocorrección. Se ha demostrado que el uso de estas microacciones mejora los resultados finales y, lo que es igual de importante, es fácil y económico de verificar.
DeepSeek fue pionera en el desarrollo de una técnica de ajuste fino de refuerzo sencilla, ilustrativa y muy influyente en el entrenamiento de su modelo de razonamiento experimental de código abierto R1-Zero.
Utilizando DeepSeek-V3 como base, DeepSeek pasó directamente del preentrenamiento a un esquema de aprendizaje por refuerzo basado en reglas extremadamente simple:
Sorprendentemente, sin ninguna instrucción explícita para hacerlo, DeepSeek-R1-Zero aprendió a generar complejas cadenas de pensamiento y a emplear estrategias de razonamiento que arrojaron un rendimiento impresionante en tareas matemáticas y de razonamiento. En otras palabras, dado solo el mandato de "pensar" antes de dar una respuesta final y maximizar la precisión de las respuestas finales, el modelo exploró y descubrió de forma natural patrones de razonamiento óptimos.
En la práctica, este enfoque simplificado tenía importantes defectos: tal y como explica el artículo técnico, "DeepSeek-R1-Zero se enfrenta a retos como la repetición infinita, la mala legibilidad y la mezcla de idiomas". Sin embargo, este enfoque de RL puro sirvió como base para la metodología más refinada que dio lugar al popular modelo DeepSeek-R1.
Mientras que la mayoría de los paradigmas de RL basados en CoT tienen como objetivo optimizar la eficacia de un único output, otros métodos generan múltiples resultados finales o intermedios con el objetivo de identificar e incentivar los mejores pasos de razonamiento.
Muchos de estos enfoques se basan en algoritmos de optimización basados en búsquedas, como la búsqueda por haces, el árbol de ideas o la búsqueda en árboles de Montecarlo (MCTS), para generar y explorar múltiples vías de razonamiento. Un modelo de recompensa por procesos (PRM) evalúa la calidad y el éxito de cada paso de razonamiento individual y, a continuación, la recompensa se propaga de forma iterativa a través de las vías de razonamiento que conducen a los resultados deseables. Optimizar los pesos del modelo para maximizar la recompensa esperada aumenta la probabilidad de que el modelo siga los caminos de razonamiento más productivos. Esto es especialmente útil para las tareas de razonamiento con una gama muy amplia de posibles decisiones o para aquellas que requieren una planificación exhaustiva a largo plazo para tener la oportunidad de llegar a una respuesta final precisa.
Mientras que los algoritmos basados en la búsqueda se centran intrínsecamente en los pasos intermedios, los enfoques de muestreo priorizan los resultados finales. La implementación más básica del escalado de inferencias basado en el muestreo es un algoritmo simple al mejor de N : proporcione la misma instrucción de entrada a un modelo N veces, utilice un modelo de recompensa por resultado (ORM) para puntuar cada resultado y seleccione el resultado en el que el ORM dé la puntuación más alta como respuesta final del modelo.
Un algoritmo clásico basado en muestreo, la autoconsistencia (también llamada votación por mayoría), no requiere un ORM. Cada tarea comienza con una cadena de pensamiento. En el decodificador del modelo se toman muestras de varias respuestas, cada una con sus propias rutas de razonamiento. Se determina que la respuesta final que aparece de forma más consistente entre los outputs muestreados es la respuesta óptima. Esto se puede utilizar como estrategia de escalado del tiempo de prueba para minimizar la aleatoriedad y la alucinación o como un medio para generar datos de razonamiento de alta calidad para métodos basados en SFT.
El principal inconveniente de los métodos basados en la búsqueda y el muestreo para los modelos de pensamiento es el aumento de la latencia, es decir, los tiempos de respuesta más largos, y la sobrecarga computacional que introducen. Sin embargo, una investigación de la Universidad Carnegie Mellon postula que los modelos más pequeños que emplean algoritmos de inferencia basados en búsquedas o muestras pueden ofrecer una compensación superior entre rendimiento y eficiencia en comparación con los modelos más grandes utilizados de forma convencional.
Una de las formas más sencillas desde el punto de vista conceptual para afinar los modelos de razonamiento es simplemente utilizar el aprendizaje supervisado en un conjunto de datos que comprenda indicaciones de entrada complejas y las correspondientes salidas basadas en CoT.
Si bien utilizar métodos convencionales para crear un conjunto de datos de entrenamiento "a mano" a través de ejemplos escritos por humanos requiere mucho tiempo y mano de obra, la proliferación de modelos de razonamiento y técnicas de escalado de inferencias ha facilitado considerablemente la generación de datos de entrenamiento sintéticos adecuados. Una investigación realizada por la Universidad de Stanford y el Allen Institute for AI descubrió que, tras afinar el Qwen2.5-32B-Instruct en un conjunto de datos seleccionado de solo 1000 parejas de preguntas y pistas de razonamiento, su modelo "s1" superó la vista previa número 1 de OpenAI en problemas matemáticos de competición.
La destilación del conocimiento también se puede utilizar para enseñar a los modelos más pequeños a emular los procesos de pensamiento de los modelos de razonamiento más grandes ajustándolos mediante SFT directamente a partir de los resultados generados por el modelo más amplio de "profesor". DeepSeek utilizó la destilación de conocimiento, con DeepSeek-R1 como profesor, para crear versiones ajustadas al razonamiento de múltiples tamaños de modelos Qwen y Llama.
Otros métodos buscan generar un conjunto de datos de instrucciones y las correspondientes salidas largas de CoT a través de un proceso de "automejora" del modelo. Razonador autodidacta (StAR) proporciona algunos ejemplos de pistas de razonamiento eficaces, luego proporciona una instrucción a un modelo para generar respuestas y motivos para un mayor número de ejemplos de preguntas. Luego, el modelo se ajusta con precisión a las razones que, en última instancia, arrojan respuestas correctas, tras lo cual el proceso se repite de forma iterativa. El autoentrenamiento reforzado (ReST) aplica un enfoque conceptual similar para afinar la señal de recompensa (o "política") utilizada para afinar. Ambos han dado lugar a una serie de metodologías derivadas.
A pesar de sus muchos puntos fuertes y beneficios, los LLM de razonamiento no están exentos de inconvenientes.
Los modelos de razonamiento (especialmente los que tienen relativamente pocos parámetros) tienden a pensar demasiado. Un estudio de Tencent concluyó que los modelos de razonamiento consumen una media de un 1953 % más de tokens que los modelos convencionales para llegar a la misma respuesta. Otro estudio [x], realizado por investigadores de varias universidades, descubrió que en los entornos de las agencias, los modelos de razonamiento tienden a utilizar un razonamiento circular extendido en lugar de interactuar con herramientas y fuentes de información externas.
Una investigación publicada por Anthropic en julio de 2025 afirmó que pensar demasiado no es solo una cuestión de eficiencia: su artículo, "Inverse Scaling in Test-Time Compute", exploró "casos en los que un razonamiento más prolongado deteriora el rendimiento y mostró una relación inversa entre el cálculo en el momento de la prueba y la precisión. " Aunque se ha demostrado empíricamente que aumentar el cálculo en tiempo de prueba puede mejorar el rendimiento del modelo, su investigación demostró múltiples escenarios para generar más tokens de razonamiento antes de que la salida final amplificara las debilidades y problemas de alineación del modelo. Esto pone en tela de juicio “la suposición de que un mayor razonamiento mejora universalmente los resultados de los modelos”.
Investigaciones relacionadas de Apple, mencionadas anteriormente en este artículo, demostraron una serie de tareas de baja complejidad en las que los modelos estándar superaban a los de razonamiento, así como tareas de alta complejidad en las que ambos tipos de modelos fallaban por completo. En las exploraciones de Apple, los modelos de razonamiento "no logran desarrollar capacidades generalizables de resolución de problemas para planificar tareas, con el rendimiento colapsando a cero más allá de cierto umbral de complejidad."
Aunque el fine-tuning del razonamiento generalmente produce una mejora importante en tareas complejas en dominios lógicos como las matemáticas y la codificación, también puede conducir a caídas de rendimiento en otros lugares. Por ejemplo, en comparación con sus contrapartes originales, las versiones de Llama 3.1 y Qwen2.5 que se ajustaron mediante destilación de conocimiento en DeepSeek-R1 mostraron una regresión significativa tanto en ArenaHard como en Alpaca-Eval-2, benchmarks populares que miden la capacidad de un modelo para idear instrucciones difíciles. Dicho esto, técnicas de razonamiento más ampliamente dirigidas, como la optimización de preferencias de pensamiento (TPO) utilizada para afinar IBM Granite 3.2, mejoran significativamente el seguimiento de instrucciones (aunque sin un impacto significativo en el rendimiento en matemáticas o codificación).
Los usuarios deben pagar (y esperar) por todos los tokens que genera el modelo mientras "piensan", y esos tokens de pensamiento se comen la ventana de contexto disponible ventana de contexto. Algunos casos de uso justifican ese tiempo y cómputo extra, pero para otros es un desperdicio de recursos. Sin embargo, cambiar constantemente de un modelo de razonamiento a un modelo "estándar" tarea por tarea e instrucción por instrucción suele ser poco práctico.
En el tiempo transcurrido desde que se lanzaron los primeros modelos de razonamiento, el sector de la IA ha adoptado en gran medida los "modelos de razonamiento híbridos" cuyo razonamiento o "esfuerzo" de pensamiento, en otras palabras, la cantidad de tokens de razonamiento que generan antes de un resultado final, se puede ajustar.
En febrero de 2025, IBM Granite 3.2 se convirtió en el primer LLM en ofrecer un modo de “pensamiento” conmutable, permitiendo a los usuarios aprovechar el razonamiento cuando lo necesiten y priorizar la eficiencia cuando no lo necesiten.16 El Sonnet Claude 3.7 de Anthropic hizo lo propio ese mismo mes, añadiendo la posibilidad de que los usuarios de la API tuvieran un control preciso sobre el tiempo durante el que el modelo "piensa". Posteriormente, Google introdujo una capacidad similar para ajustar el “presupuesto de pensamiento” de los modelos Gemini, y OpenAI pronto permitió que el “esfuerzo de razonamiento” de sus modelos de razonamiento o1 y o3 se configurara en “bajo”, “medio” o “alto”.
En el tiempo transcurrido desde entonces, este enfoque se ha convertido básicamente en estándar. Aunque algunas familias importantes de modelos de lenguaje continúan siendo publicadas con distintas variantes de razonamiento y sin razonamiento, la mayoría de los proveedores simplemente lanzan modelos con capacidad de razonamiento cuyo esfuerzo de razonamiento puede ser deshabilitado por el usuario.
En teoría, revelar la cadena de pensamientos del modelo al usuario ayuda a comprender exactamente cómo un LLM llega a sus respuestas finales, proporcionando una mayor interpretabilidad de la que normalmente es posible con un modelo estándar. Pero una investigación de Anthropic sugiere que los modelos de razonamiento no siempre dicen lo que realmente Think. A través de una serie de tareas especialmente diseñadas, los investigadores descubrieron que tanto Claude 3.7 Sonnet como DeepSeek-R1 no explicaban fielmente su razonamiento: por ejemplo, cuando se les proporcionaban pistas de la respuesta correcta, sus respuestas rara vez mencionaban esas pistas al describir su supuesta justificación.
Explore la biblioteca de modelos fundacionales de IBM en la cartera de watsonx para escalar la IA generativa para su negocio con confianza.
Ponga la IA a trabajar en su negocio con la experiencia líder en IA del sector de IBM y junto a su cartera de soluciones.
Reinvente las operaciones y flujos de trabajo críticos añadiendo IA para maximizar las experiencias, la toma de decisiones en tiempo real y el valor empresarial.