¿Qué es un modelo de razonamiento?

¿Qué es un modelo de razonamiento?

Un modelo de razonamiento, también llamado modelo de pensamiento o modo de razonamiento grande (LRM), es un modelo de lenguaje grande (LLM) que ha sido afinado para realizar la resolución de problemas de múltiples pasos mediante la generación de pasos intermedios, a menudo llamados “rastreos de razonamiento”, a través del cual refina iterativamente su resultado antes de generar su respuesta final.

Entrenados para emplear un razonamiento sofisticado de cadena de pensamiento y otras estrategias de toma de decisiones de múltiples pasos, los modelos de razonamiento representan la vanguardia del rendimiento de LLM, particularmente en matemáticas, programación y otros dominios impulsados por el razonamiento lógico. Originalmente introducidos como una categoría de modelo distinta y especializada, estos “modelos de pensamiento” se han vuelto cada vez más ubicuos: hoy en día, la mayoría de los LLM modernos ofrecen un “modo de pensamiento” o capacidades de razonamiento con nombres similares.

El concepto de “modelo de razonamiento” fue introducido por primera vez por o1-preview (y o1-mini) de OpenAI en septiembre de 2024, seguido por el “Qwen with Questions” de Alibaba (QWQ-32b-preview) en noviembre y el experimento Flash Gemini 2.0 de Google en diciembre. Un hito en el desarrollo de LLM de razonamiento fue la publicación en enero de 2025 del modelo de código abierto DeepSeek-R1. Mientras que los procesos de entrenamiento utilizados para ajustar los modelos de razonamiento anteriores habían sido secretos muy bien guardados, DeepSeek publicó un documento técnico detallado que proporcionó un proyecto técnico para otros desarrolladores de modelos. IBM Granite, Anthropic y Mistral IA, entre otros, han lanzado desde entonces sus propios LLM de razonamiento.

En pocas palabras, los LLM de razonamiento están entrenados para pasar más tiempo “pensando” antes de responder. Se ha demostrado empíricamente que la adición de este “proceso de razonamiento” produce importantes avances en el desempeño de LLM en tareas de razonamiento complejas. Este éxito ha ampliado los casos de uso y los dominios del mundo real a los que se pueden aplicar los modelos de IA, lo que marca un importante punto de inflexión en el desarrollo continuo de la IA generativa y los agentes de IA.

Sin embargo, vale la pena señalar que los términos antropomórficos como el “proceso de pensamiento” de un modelo son más convenientes que literales. Al igual que todos los modelos de machine learning, los modelos de razonamiento consisten, en última instancia, en solo aplicar algoritmos sofisticados para hacer predicciones, como qué palabra debería venir a continuación, que reflejan patrones aprendidos a partir de datos de entrenamiento. Los LLM de razonamiento no demostraron conciencia ni otros signos de inteligencia artificial general (AGI). Un artículo de investigación de Apple ampliamente citado presentado en NeurIPS 2025 pone en duda si las habilidades de razonamiento del modelo actual pueden escalar a un razonamiento verdaderamente “generalizable”.

Quizás sea más exacto decir que los LLM de razonamiento están entrenados para “mostrar su trabajo” generando una secuencia de tokens (palabras) que se asemejan a un proceso de pensamiento humano, y que este acto de “verbalizar” pensamientos parece desbloquear capacidades de razonamiento latentes que los LLM aprenden implícitamente de su masivo corpus de datos de entrenamiento (que contiene ejemplos de personas que articulan directa e indirectamente sus propios procesos). 

¿Por qué funcionan los modelos de razonamiento?

Agregar un "proceso de pensamiento" a los resultados del modelo mitiga muchos de los defectos inherentes de la inferencia de LLM estándar al ayudar al modelo a evitar atajos cognitivos dañinos y a revelar conocimientos potencialmente más relevantes que aprendió de los datos de entrenamiento.

En el contexto de los LLMs de razonamiento, la literatura de investigación en IA suele hacer referencia al pensamiento Sistema 1 y Sistema 2, términos acuñados por el economista conductual galardonado con el Premio Nobel Daniel Kahneman en su obra fundamental Pensar rápido, pensar despacio. El pensamiento del Sistema 1 es rápido, inconsciente e intuitivo, se basa en heurísticas y conlleva poco o nulo esfuerzo. El pensamiento del Sistema 2 es lento, deliberado y lógico, y requiere un esfuerzo concertado. Las investigaciones demostraron de forma constante que los LLM autoregresivos tienden, por defecto, al pensamiento del Sistema 1.

Para algunas tareas, el pensamiento del Sistema 1 es eficaz y computacionalmente eficiente. Pero para muchas otras, el pensamiento impulsivo del Sistema 1 no funciona. Por ejemplo, un artículo de 2023 de los investigadores de Meta Jason Weston y Sainbayar Sukhbaatar señaló cómo los LLM se dejan influenciar fácilmente por la presencia de contexto irrelevante o detalles subjetivos en la instrucción de entrada.

Ejemplos de LLM Ejemplo de cómo los LLM que no razonan a menudo se "distraen" con información irrelevante. Tomado del documento "System 2 Attention (is something you might also need)".

Propusieron una clase de técnicas que denominaron "Atención del sistema 2" (S2A), en las que se instruye al modelo para que primero genere una versión reescrita de la instrucción de entrada despojada del contexto irrelevante y luego responda a esa instrucción reescrita. En los experimentos, S2A superó la inferencia estándar en una variedad de tareas, aumentando la precisión y disminuyendo la adulación.

Problemas de LLM y ejemplos de soluciones S2A, uno de los primeros métodos de escalado de inferencias. Al agregar pasos entre la entrada y la respuesta, en este caso, para reescribir la instrucción original, el modelo mejora su resultado final. Tomado del documento "System 2 Attention (is something you might also need)".

Conceptualmente hablando, el objetivo implícito de los enfoques de razonamiento podría entenderse como la implementación de un comportamiento del modelo similar al sistema 2 que explora, evalúa y refina sus posibles resultados.

La base para los “modelos de pensamiento” modernos fue establecida por los primeros trabajos de investigación de LLM: uno escrito por Google Research en 2021 y otro escrito por investigadores de la Universidad de Tokio en 2022. Ambos demostraron que el simple hecho de agregar la frase “pensar paso a paso” —una técnica llamada cadena de pensamiento— mejora significativamente los resultados del modelo. Un documento de 2024 de Google DeepMind hizo una afirmación aún más amplia al proponer una nueva ley de escalado: escalar el cómputo en tiempo de prueba (los recursos utilizados para generar un resultado) aumenta el rendimiento del modelo tanto como escalar el cómputo en tiempo de entrenamiento (los recursos utilizados para entrenar un modelo). Las instrucciones de CoT son simplemente una de las muchas técnicas de escalado de inferencia (también llamado escalado en tiempo de prueba), al igual que S2A.

Los LLM de razonamiento modernos van más allá: en lugar de depender de una ingeniería rápida, utilizan técnicas novedosas de ajuste y flujos de trabajo sofisticados para aumentar intrínsecamente la cantidad de cómputo que utiliza el modelo en el momento de la inferencia. La optimización de un modelo de razonamiento conlleva tanto el reto técnico de desarrollar algoritmos y datos de entrenamiento como el desafío filosófico de diseñar un “proceso de pensamiento” ideal.

¿Cómo funcionan los modelos de razonamiento?

Las etapas iniciales del entrenamiento de los LLM de razonamiento son similares a las de los LLM convencionales. Al igual que los LLM estándar, los modelos de razonamiento obtienen su facilidad lingüística general y conocimiento del mundo a partir del entrenamiento previo autosupervisado a gran escala, seguido de cierta cantidad de ajuste supervisado (SFT) para adaptarlo a tareas posteriores (como el uso de chatbot conversacional). La innovación central es la aplicación de novedosas técnicas de aprendizaje por refuerzo (RL) que incentivan al modelo a generar "pasos de razonamiento" intermedios en el momento de la inferencia antes de producir un resultado final.

Años de investigación y experimentación han producido una variedad de enfoques de razonamiento en expansión exponencial, pero todos comparten el objetivo fundamental de aumentar la computación en tiempo de prueba. Además del LLM básico (o ajustado a las instrucciones) que sirve como base, los modelos de razonamiento se diferencian por las estrategias específicas de toma de decisiones que están entrenados para emplear y los algoritmos específicos utilizados para incentivar ese comportamiento.

En términos generales, existen 2 métodos principales para aumentar el cómputo utilizado en el momento de la inferencia. El objetivo de ajustar un modelo de razonamiento es entrenarlo para emplear uno de estos enfoques amplios (o ambos) a través de varios algoritmos de aprendizaje.

  • Generar resultados más largos: el modelo aprende a generar secuencias de resultados más largas a través de estrategias que incluyen una larga cadena de pensamiento, retroceso y autorrefinamiento.

  • Generar múltiples salidas: en lugar de generar una única salida en respuesta a una instrucción, el modelo genera múltiples iteraciones de su salida y llega a su respuesta final a través de un proceso de búsqueda, rechazo y agregación de posibles salidas.  

La naturaleza de los paradigmas de aprendizaje que producen modelos de razonamiento generalmente implica entrenamiento y evaluación de problemas cuyas soluciones son de naturaleza verificable, como tareas de programación o problemas matemáticos. Por lo tanto, las métricas de punto de referencia utilizadas para evaluar el rendimiento del modelo de razonamiento suelen centrarse en esos dominios. Se han realizado muchas menos investigaciones sobre el impacto del razonamiento en dominios más subjetivos, como la escritura creativa.

Ajuste de refuerzo

Un elemento central del auge de los LLM de razonamiento ha sido el avance del ajuste basado en RL, que comprende tanto el RL basado en reglas como el RL basado en el aprendizaje profundo ("RL profundo") en contextos de LLM. Mientras que el aprendizaje supervisado y autosupervisado requiere tareas de entrenamiento estáticas y bien definidas, el RL se adapta bien al tipo de tareas dinámicas, abiertas y complejas para las que el razonamiento de varios pasos es el más útil.

El uso de RL para ajustar los LLM de una manera que imparta cualidades abstractas no es exclusivo de los modelos de razonamiento. Por ejemplo, el pipeline de entrenamiento estándar para un LLM que se utilizará en la configuración de chatbot es el siguiente:

  1. Preentrenamiento autosupervisado, en el que el modelo aprende los patrones lingüísticos y los conocimientos básicos que se aplicarán a las tareas posteriores.

  2. Ajuste supervisado (SFT), en el que el modelo aprende a formatear correctamente sus respuestas a las entradas del usuario.

  3. Ajuste de instrucciones, en el que el modelo aprende a seguir instrucciones y realizar tareas específicas.

  4. Aprendizaje por refuerzo a partir de feedback humano (RLHF), en el que el modelo se ajusta a los datos de preferencias humanas para impartir cualidades subjetivas como utilidad, inocuidad, veracidad y tono ideal.

Los LLM de razonamiento suelen pasar por esas mismas etapas de entrenamiento, con la adición (en algún momento) de una etapa de aprendizaje por refuerzo que inculca un proceso productivo de razonamiento basado en CoT. Esto se logra definiendo los objetivos de este proceso de razonamiento (los comportamientos específicos del modelo que se "recompensarán", como generar rastros de razonamiento CoT antes de un resultado final) y luego optimizar las ponderaciones del modelo de una manera que maximice la recompensa.

Debido a que es difícil o incluso imposible diseñar una función de recompensa explícita para una tarea tan abstracta y compleja como un proceso de razonamiento que será eficaz para la resolución de todos los problemas complejos, esta señal de recompensa a menudo proviene de un modelo de recompensa separado utilizado durante el entrenamiento. En el RLHF, este modelo de recompensa se entrena con feedback humano y aprende a predecir una puntuación numérica de cuánto preferiría un humano una respuesta determinada.

En el contexto de RL para modelos de razonamiento, las señales de recompensa se pueden dividir en 3 categories amplias: modelos de recompensa de resultados (ORM), modelos de recompensa de procesos (PRM) y sistemas de recompensa basados en reglas.

Modelos de recompensa de resultados (ORM)

Los modelos de recompensa por resultados (ORM), como su nombre indica, verifican la precisión de los resultados del modelo de razonamiento y proporcionan señales de recompensa que se utilizan para optimizar las ponderaciones del modelo en consecuencia. Esto es superficialmente similar al rol de una función de pérdida en el aprendizaje supervisado, aunque las mecánicas suelen ser más complejas.

Mientras que una función de pérdida suele medir la divergencia token por token entre la salida de un modelo y la verdad fundamental, un ORM eficaz debe ser capaz de reconocer una respuesta correcta a un problema matemático incluso cuando se presenta de manera muy diferente de la respuesta verdadera disponible, que es a menudo el caso dada la alta variabilidad de los resultados largos de CoT. Del mismo modo, la mayoría de los problemas de programación del mundo real tienen múltiples soluciones: la evaluación integral de los resultados del código generalmente requiere un pipeline de datos que ejecute y verifique de manera eficiente la eficacia de los fragmentos de código. Otras cualidades de salida, como si sigue el formato o las instrucciones prescritos, pueden usar un LLM estándar como verificador.

Si bien los ORM son una solución relativamente sencilla y computacionalmente eficiente, pueden recompensar potencialmente situaciones en las que los pasos de razonamiento defectuosos conducen a una respuesta final correcta, lo que da como resultado que el modelo aprenda procesos de razonamiento subóptimos.

Modelos de recompensa de procesos (PRM)

Los modelos de recompensa de procesos (PRM) puntúan y recompensan (o penalizan) cada paso de razonamiento individual de forma aislada, en lugar de centrarse únicamente en la precisión de la respuesta final. Esto proporciona señales de recompensa más detalladas y ajustes posteriores del modelo, lo que produce modelos con un proceso de razonamiento más robusto e interpretable.

Sin embargo, los PRM son más costosos y requieren más tiempo de entrenamiento e implementación. Los primeros enfoques influyentes para los PRM, como el conjunto de datos PRM800K de OpenAI, se basaron casi por completo en el laborioso etiquetado de datos de anotadores humanos. Muchos enfoques posteriores, como el influyente Math-Shepherd, han automatizado este proceso al inferir la validez de un paso de razonamiento basado en la frecuencia con la que resulta en una respuesta correcta.

Sistemas de recompensa basados en reglas

Para evitar los costos y las complicaciones de los modelos de recompensa, algunos enfoques de ajuste basados en RL diseñan tareas de entrenamiento de una manera que simplifica el acto de evaluar los resultados del modelo.

Por ejemplo, las técnicas DeepSeek-R1 y R1-Zero dan instrucciones a los modelos para que formateen sus respuestas finales dentro de un cuadro separado, permitiendo verificar la precisión sin necesidad de un modelo de recompensa especializado que deba analizar toda la respuesta. Otros sistemas de recompensa basados en reglas incentivan microacciones específicas, como agregar periódicamente esperar a la respuesta del modelo para fomentar una mayor exploración y autocorrección. Se demostró que el uso de estas microacciones mejora los resultados finales y, también importante, es fácil y económico de verificar.

DeepSeek-R1-Zero: RL puro

DeepSeek fue pionera en una técnica de ajuste de refuerzo simple, ilustrativa y muy influyente en el entrenamiento de su modelo de razonamiento experimental R1-Zero de código abierto.

Con DeepSeek-V3 como base, DeepSeek pasó directamente del entrenamiento previo a un esquema de aprendizaje por refuerzo basado en reglas extremadamente simple:

  • Consulta del modelo: haga una pregunta al modelo. Dele una instrucción para generar el resultado de un proceso de pensamiento entre “<think> ” y “</think> ” tokens, y para generar el resultado de su respuesta final entre “<answer> ” y “</answer> ” tokens.

  • Recompensas de precisión: recompense al modelo por la calidad de su respuesta final, como qué tan bien se ejecuta su código generado.

  • Formato de recompensas: recompensar al modelo por usar correctamente el “<think> </think> ” y “ formato<answer> </answer> ” en las respuestas.

Sorprendentemente, sin ninguna instrucción explícita para hacerlo, DeepSeek-R1-Zero aprendió a generar cadenas de pensamiento complejas y emplear estrategias de razonamiento que arrojaron un rendimiento impresionante en tareas matemáticas y de razonamiento. En otras palabras, dado solo el mandato de "pensar" antes de generar una respuesta final y maximizar la precisión de las respuestas finales, el modelo exploró y descubrió de forma natural patrones de razonamiento óptimos.

En términos prácticos, este enfoque simplificado tenía fallas importantes: como explica el documento técnico, "DeepSeek-R1-Zero enfrenta desafíos como la repetición interminable, la mala legibilidad y la mezcla de idiomas". Sin embargo, este enfoque puro de RL sirvió como base de la metodología más refinada que produjo el popular modelo DeepSeek-R1.

Enfoques basados en búsquedas y muestras

Mientras que la mayoría de los paradigmas de RL basados en CoT tienen como objetivo optimizar la eficacia de un único resultado del modelo, otros métodos generan múltiples resultados finales o intermedios con el objetivo de identificar e incentivar los mejores pasos de razonamiento.

Muchos de estos enfoques se basan en algoritmos de optimización basados en la búsqueda, como la búsqueda por haz, el árbol de pensamientos o una búsqueda en árbol de Monte Carlo (MCTS), para generar y explorar múltiples rutas de razonamiento. Un modelo de recompensa por proceso (PRM) evalúa la calidad y el éxito de cada paso de razonamiento individual, y luego se retropropaga iterativamente una recompensa a través de las rutas de razonamiento que llevaron a los resultados deseados. Optimizar las ponderaciones del modelo para maximizar la recompensa esperada aumenta la probabilidad de que el modelo siga las rutas de razonamiento más productivas. Esto es particularmente útil para tareas de razonamiento con una gama muy amplia de decisiones potenciales o aquellas que requieren una planificación extensa a largo plazo para tener la oportunidad de llegar a una respuesta final precisa.

Mientras que los algoritmos basados en la búsqueda se centran inherentemente en pasos intermedios, los enfoques de muestreo priorizan los resultados finales. La implementación más básica del escalado de inferencia basado en muestreo es un algoritmo simple best-of-N: proporcionar la misma instrucción de entrada a un modelo N veces, usar un modelo de recompensa de resultado (ORM) para puntuar cada resultado y seleccionar el resultado para el que el ORM otorgue la puntuación más alta como la respuesta final del modelo.

Un algoritmo tradicional basado en ejemplificación, la autoconsistencia (también llamada votación por mayoría), no requiere un ORM. Cada tarea comienza con una cadena de pensamiento. Se muestrean múltiples respuestas, cada una con sus propias rutas de razonamiento, del decodificador del modelo. Se determina que la respuesta final que aparece de manera más consistente entre los resultados muestreados es la respuesta óptima. Esto se puede utilizar como estrategia de escalado del tiempo de prueba para minimizar la aleatoriedad y la alucinación o como un medio para generar datos de razonamiento de alta calidad para métodos basados en SFT.

El principal inconveniente de los métodos basados en búsqueda y muestreo para los modelos de pensamiento es el aumento de la latencia, es decir, tiempos de respuesta más largos, y la sobrecarga computacional que introducen. Sin embargo, una investigación de la Universidad Carnegie Mellon postula que los modelos más pequeños que emplean algoritmos de inferencia basados en búsquedas o muestras pueden ofrecer una compensación de rendimiento y eficiencia superior a los modelos más grandes utilizados convencionalmente.

Enfoques de SFT, destilación del conocimiento y automejora

Una de las formas conceptualmente más sencillas de ajustar los modelos para el razonamiento es simplemente utilizar el aprendizaje supervisado en un conjunto de datos que comprende instrucciones de entrada desafiantes y las correspondientes salidas basadas en CoT.

Si bien el uso de métodos convencionales para ensamblar un conjunto de datos de entrenamiento “a mano” a través de ejemplos escritos por humanos es prohibitivamente laborioso en tiempo y trabajo, la proliferación de modelos de razonamiento y técnicas de escala de inferencia ha hecho que sea significativamente más fácil generar datos de entrenamiento sintético adecuados.  Una investigación realizada por la Universidad de Stanford y el Allen Institute for AI encontró que después de ajustar el modo Qwen2.5-32B-Instruct en un conjunto de datos curado de solo 1000 pares de preguntas y rastreos de razonamiento, su modelo “s1” superó a o1-preview de OpenAI en problemas matemáticos de competencia.

La destilación del conocimiento también se puede utilizar para enseñar a modelos más pequeños a emular los procesos de pensamiento de modelos de razonamiento más grandes ajustándolos a través de SFT directamente en los resultados generados por el modelo “maestro” más grande. DeepSeek utilizó la destilación de conocimientos, con DeepSeek-R1 como maestro, para crear versiones ajustadas al razonamiento de múltiples tamaños de modelos Qwen y Llama.

Otros métodos apuntan a iniciar un conjunto de datos de instrucciones y los correspondientes resultados largos de CoT a través de un proceso de “mejora interna” del modelo. Self-Taught Reasoner (STaR) ofrece ejemplos few-shot de rastreos de razonamiento efectivos, y lle da una instrucción a un modelo para generar respuestas y justificaciones para un mayor número de preguntas de muestra. El modelo se ajusta con fundamentos que finalmente arrojaron respuestas correctas, luego de lo cual el proceso se repite iterativamente. Reinforced Self-Training (ReST) aplica un enfoque conceptual similar para ajustar la señal (o “política”) de recompensa utilizada para el ajuste de refuerzo. Ambos han producido una serie de metodologías derivadas.

AI Academy

Elija el modelo de IA adecuado para su caso de uso

Más grande no siempre es mejor cuando se trata de modelos de IA. Aprenda a encontrar la solución que mejor se adapte a las necesidades de su empresa. A continuación, obtenga la guía que le ayudará a pasar a la acción.

Desafíos de los modelos de razonamiento

A pesar de sus muchas fortalezas y beneficios, los LLM de razonamiento no están exentos de inconvenientes.

Pensar demasiado

Los modelos de razonamiento, particularmente aquellos con relativamente pocos parámetros, son propensos a pensar demasiado. Un estudio de Tencent encontró que los modelos de razonamiento consumen un promedio de 1953 % más tokens que los modelos convencionales para llegar a la misma respuesta. Otro estudio[x], realizado por investigadores en múltiples universidades, encontró que, en entornos agénticos, los modelos de razonamiento tienden a involucrarse en el razonamiento circular extendido en lugar de interactuar con herramientas externas y fuentes de información.

Limitaciones del escalado de inferencia

Según la investigación publicada por Anthropic en julio de 2025, ese exceso de pensamiento no es únicamente una preocupación de eficiencia: su artículo, “Inverse Scaling in Test-Time Compute”, explora “casos en los que el razonamiento más largo deteriora el rendimiento, mostrando una relación inversa entre el cómputo en tiempo de prueba y la precisión”. Si bien se ha demostrado empíricamente que aumentar el cómputo en tiempo de prueba a menudo puede mejorar el rendimiento del modelo, su investigación demostró múltiples escenarios para generar más tokens de razonamiento antes de que el resultado final amplificara las debilidades del modelo y los problemas de alineación. Esto desafía “la suposición de que un mayor razonamiento mejora universalmente los resultados del modelo”.

Una investigación relacionada de Apple, mencionada anteriormente en este artículo, demostró una serie de tareas de baja complejidad en las que los modelos estándar superaron a los modelos de razonamiento, así como tareas de alta complejidad en las que ambos tipos de modelos fallaron rotundamente. En las exploraciones de Apple, los modelos de razonamiento “no logran desarrollar capacidades generalizables de resolución de problemas para las tareas de planificación, y el rendimiento se reduce a cero más allá de cierto umbral de complejidad”.

Degradación en dominios sin razonamiento

Si bien el ajuste del razonamiento generalmente produce una mejora importante en tareas complejas en dominios lógicos como matemáticas y programación, también puede llevar a caídas del rendimiento en otros lugares. Por ejemplo, en comparación con sus contrapartes originales, las versiones de Llama 3.1 y Qwen2.5 que se ajustaron mediante destilación del conocimiento en DeepSeek-R1 mostraron regresión significativa tanto en ArenaHard como en Alpaca-Eval-2, puntos de referencia populares que miden la capacidad de un modelo para pensar a través de instrucciones difíciles. Dicho esto, las técnicas de razonamiento más ampliamente dirigidas, como la optimización de preferencias de pensamiento (TPO) para ajustar IBM Granite 3.2, mejoran significativamente el seguimiento de instrucciones (aunque sin un impacto significativo en el rendimiento en matemáticas o programación).

Mayor costo y latencia

Los usuarios deben pagar (y esperar) por todo el token que genera el modelo mientras "piensan", y esos tokens pensantes se comen la ventana de contexto disponible. Algunos casos de uso justifican ese tiempo y cómputo adicionales, pero para otros es un desperdicio de recursos. Sin embargo, cambiar constantemente de un modelo de razonamiento a un modelo "estándar" tarea por tarea e instrucción por instrucción suele ser poco práctico.

Esfuerzo de razonamiento y modelos de razonamiento híbrido

En el tiempo transcurrido desde que se lanzaron los primeros modelos de razonamiento, la industria de IA ha adoptado en gran medida “modelos de razonamiento híbridos” cuyo “esfuerzo” de razonamiento o pensamiento —en otras palabras, la cantidad de tokens de razonamiento que generan antes de un resultado final— se puede ajustar.

En febrero de 2025, IBM Granite 3.2 se convirtió en el primer LLM en ofrecer un modo de “pensamiento” conmutable, que permite a los usuarios aprovechar el razonamiento cuando lo necesitan y priorizar la eficiencia cuando no lo necesitan.16 Claude 3.7 Sonnet de Anthropic hizo lo propio ese mismo mes, agregando la posibilidad de que los usuarios de la API controlaran con precisión cuánto tiempo el modelo “piensa”. Posteriormente, Google introdujo una capacidad similar para ajustar el “presupuesto de pensamiento” de los modelos Gemini, y OpenAI pronto permitió que el “esfuerzo de razonamiento” de sus modelos de razonamiento o1 y o3 se estableciera en “bajo”, “medio” o “alto”. 

En el tiempo transcurrido desde entonces, este enfoque se ha convertido esencialmente en estándar. Aunque algunas familias importantes de modelos de lenguaje continúan siendo publicadas con distintas variantes de razonamiento y sin razonamiento, la mayoría de los proveedores simplemente lanzan modelos con capacidad de razonamiento cuyo esfuerzo de razonamiento puede deshabilitarlo el usuario.

Interpretabilidad

Aparentemente, revelar la cadena de pensamientos del modelo al usuario ayuda a comprender exactamente cómo un LLM llega a sus respuestas finales, proporcionando una mayor interpretabilidad de la que suele ser posible con un modelo estándar. Pero una investigación de Anthropic sugiere que los modelos de razonamiento no siempre dicen lo que realmente piensan. A través de una serie de tareas especialmente diseñadas, los investigadores descubrieron que tanto Claude 3.7 Sonnet como DeepSeek-R1 no explicaban fielmente su razonamiento: por ejemplo, cuando se les proporcionaban pistas de la respuesta correcta, sus respuestas rara vez mencionaban esas pistas al describir su supuesta justificación.

Autor

Dave Bergmann

Senior Staff Writer, AI Models

IBM Think

Soluciones relacionadas
Modelos fundacionales

Explore la biblioteca de modelos fundacionales de IBM en la cartera de watsonx para escalar la IA generativa para su negocio con confianza.

Descubra watsonx.ai
Soluciones de inteligencia artificial

Ponga la IA a trabajar en su negocio con la experiencia en IA líder en la industria y la cartera de soluciones de IBM a su lado.

Explore las soluciones de IA
Consultoría y servicios de IA

Reinvente los flujos de trabajo y las operaciones críticas añadiendo IA para maximizar las experiencias, la toma de decisiones en tiempo real y el valor empresarial.

Conozca los servicios de IA
Dé el siguiente paso

Explore la biblioteca de modelos fundacionales de IBM watsonx en la cartera de watsonx para escalar la IA generativa para su negocio con confianza.

  1. Descubra watsonx.ai
  2. Explorar los modelos de IA de IBM Granite