La depuración con IA, también llamada depuración asistida por IA, es el uso de inteligencia artificial, principalmente modelos de lenguaje grandes (LLM), para encontrar, explicar y corregir errores de software. Un error es un defecto que provoca que un programa funcione mal o se bloquee; la depuración consiste en encontrar y corregir dichos fallas. En la mayoría de los casos, la depuración con IA complementa la depuración manual en lugar de reemplazarla: los humanos siguen verificando los arreglos sugeridos por las máquinas.
El 9 de septiembre de 1947, los ingenieros de la computadora Harvard Mark II encontraron una polilla en uno de sus relés y la pegaron en su bitácora —“primer caso real de bug encontrado”— una página ahora en el Smithsonian.1 La informática Grace Hopper del equipo Mark II popularizó la historia, aunque el término es anterior a ella: Thomas Edison se quejó de “bugs” en una carta de 1878, y el Oxford English Dictionary sitúa este uso de ingeniería en las décadas de 1870 y 1880.2
Los bugs de ingeniería suelen presentarse de tres maneras.3 Los bugs de sintaxis interrumpen la gramática de un lenguaje de programación (un ejemplo podría ser la falta de un paréntesis) y se detectan antes de que se ejecute el programa. Los errores de tiempo de ejecución se producen cuando el código válido falla a mitad de la ejecución, como al dividir por cero. Los errores lógicos son los más insidiosos: el programa se ejecuta sin quejas, pero da la respuesta incorrecta.
Los desarrolladores pueden defenderse con pruebas automatizadas (pruebas unitarias que comprueban cada pequeño fragmento de código con los resultados esperados) y con depuradores, que pausan un programa en ejecución para su inspección. Un punto de interrupción, una línea marcada donde la ejecución se detiene, permite al desarrollador avanzar paso a paso por el programa, examinando variables; el pdb integrado de Python es un ejemplo típico. Un fallo total suele producir un rastro de pila, un informe de las llamadas a funciones que provocaron el error.4
Un estudio de la Cambridge Judge Business School de 2013 estimó que los desarrolladores dedican, en promedio, la mitad de su tiempo de programación a encontrar y corregir bugs, lo que supone un costo aproximado de 312 000 millones de dólares al año a nivel mundial.5 La promesa de la depuración asistida por IA, por supuesto, es reducir ese costo.
Manténgase al día sobre las tendencias más importantes e intrigantes de la industria sobre IA, automatización, datos y más con el boletín Think. Consulte la Declaración de privacidad de IBM.
Un LLM es un sistema de machine learning entrenado en grandes cantidades de texto y código para predecir el siguiente “token” (palabra, bit de palabra o símbolo): la misma tecnología de procesamiento de lenguaje natural detrás de los chatbots de IA como ChatGPT o Claude. En el entrenamiento, efectivamente “lee” miles de millones de líneas de código público, además de mensajes de error circundantes, informes de bugs y arreglos. Cuando un LLM llega al mercado, es probable que haya visto millones de bugs y digerido sus resoluciones.
Los datos documentados de entrenamiento de código abierto incluyen conversaciones de “problema” y “solicitud de extracción” de GitHub, registros donde los desarrolladores reportan bugs y arreglos, lo que permite que los modelos especialmente entrenados tengan acceso a un registro documental que muestra cómo los programadores humanos reparan el código defectuoso.
En un flujo de trabajo común de depuración con IA, el desarrollador le da al modelo el código relevante y el mensaje de error o seguimiento de la pila; luego, el modelo explica la causa probable y sugiere arreglos candidatos. Los sistemas de investigación como ChatDBG van más allá, conectando los LLM a depuradores estándar como GDB, LLDB y Python, para que un desarrollador pueda hacer preguntas en lenguaje simple: “¿por qué x es nulo?”, mientras el modelo inspecciona el programa en vivo, realiza análisis de causa principal y propone arreglos.6.
Existen algunas limitaciones que deben tener en cuenta quienes se inician en la depuración con IA. Primero, el contexto importa, una práctica asociada con la ingeniería rápida. Las instrucciones vagas tienen más probabilidades de producir diagnósticos vagos; un enfoque más útil es proporcionar el error exacto, la prueba fallida y un poco de código sospechoso. Los usuarios también deben ser conscientes de la ventana de contexto de un modelo: la cantidad máxima de texto (medida en “tokens” o fragmentos de unos pocos caracteres cada uno) que un modelo puede considerar a la vez. Los bugs reales en bases de código complejas a menudo abarcan varios archivos, como muestra el punto de referencia SWE-bench de problemas reales de GitHub, y un modelo que no puede ajustar todo el código relevante en su contexto puede tener dificultades para razonar al respecto.
La depuración con IA generalmente ocurre a través de asistentes de programación de IA integrados o construidos alrededor del espacio de trabajo de programación del desarrollador, generalmente un entorno de desarrollo integrado (o IDE). GitHub Copilot, por ejemplo, es un asistente de programación que puede sugerir código dentro de IDE populares; Cursor y Windsurf son espacios de trabajo de programación orientados a la IA que sitúan la asistencia similar más cerca del centro de la experiencia de programación.7 Y a medida que el auge de la “ingeniería agéntica” se convierte en la norma, se diseña algún software con la ventana de chat del asistente de programación pensada como el panel primario en el que el usuario humano interactúa con el IDE; esta es una forma de utilizar IBM Bob, entre otras.
A menudo, los asistentes de programación son independientes del modelo; GitHub Copilot, por ejemplo, puede usar modelos de proveedores como OpenAI, Anthropic y Google; xAI también ha descrito su modelo Grok Code Fast 1 como construido para flujos de trabajo de agente de programación y disponible a través de herramientas como Copilot, Cursor y Windsurf.8 9 Por su parte, IBM utiliza varios modelos, enrutamiento automático de consultas a un modelo apropiado basado en la complejidad y el costo; los materiales de lanzamiento de 2026 se refieren a “una mezcla de modelos de frontera que incluyen Anthropic Claude, modelos de código abierto Mistral e IBM Granite, junto con modelos especializados ajustados para razonamiento de código, seguridad y predicción de próxima edición”.
Algunos agentes de depuración de IA son generalistas; otros son especialistas. En el lado generalista del espectro, al agente de programación Copilot de GitHub, introducido en 2025, se le puede asignar un problema de GitHub, mientras que se puede trabajar en segundo plano usando GitHub Actions y enviar sus cambios propuestos como una solicitud de extracción (un paquete de cambios de código para que un desarrollador humano lo revise).10 Con su combinación de modelos, IBM Bob también se inclina por el generalismo. En el lado especializado está Copilot Autofix, que se dirige específicamente a las vulnerabilidades de seguridad. Para ello, combina CodeQL, el motor de escaneo de código de GitHub, con explicaciones generadas por IA y arreglos sugeridos. El ahorro de tiempo puede ser impresionante; GitHub reporta un tiempo de arreglo promedio de 28 minutos frente a 1.5 horas manualmente.11
Si bien son impresionantes, los resultados en la frontera de la IA generativa son desiguales. El reciente estudio del CEO de IBM sobre 2000 directores ejecutivos encontró que solo el 25 % de las iniciativas de IA había entregado su retorno de inversión esperado en los últimos años.
Los resultados mixtos también se aplican a la depuración con IA. En un estudio de DebugBench de 2024, los investigadores descubrieron que los modelos de código cerrado aún no alcanzaban el rendimiento humano en general, y que los errores lógicos eran significativamente más difíciles de reparar que los errores de sintaxis y referencia.12
Sin embargo, herramientas mejores y más especializadas están aumentando las perspectivas. ChatDBG, por ejemplo, conecta un LLM a un depurador en vivo, lo que le da visibilidad de lo que estaba haciendo exactamente el programa cuando falló (en lugar de solo el texto del código sospechoso). En una evaluación, una sola consulta de ChatDBG produjo un arreglo aplicable en la práctica para programas Python el 67 % de las veces; permitió solo una pregunta de seguimiento y la tasa subió al 85 %.13
Para complicar aún más las cosas, los criterios de evaluación de los modelos cambian constantemente. SWE-bench Pro, un sucesor más exigente del famoso SWE-bench14, fue diseñado para ser más realista y resistente a la contaminación; en una evaluación reciente, los mejores modelos de frontera se mantuvieron por debajo del 25 %, con GPT-5 en el 23.3 %.15
El comportamiento de los desarrolladores puede estar cambiando más rápido de lo que se puede medir científicamente. El ensayo aleatorizado de principios de 2025 de METR encontró que los desarrolladores experimentados de código abierto tardaron un 19 % más al usar herramientas de IA, pero METR rápidamente calificó esos resultados como desactualizados; una continuación de 2026 encontró cierta videncia de productividad acelerada, agregando que esta aceleración era difícil de medir con precisión.16 La explicación de METR sobre esa dificultad es contundente: “Hemos observado un aumento significativo en los desarrolladores que optan por no participar en el estudio porque no desean trabajar sin IA, lo que probablemente sesga a la baja nuestra estimación de la aceleración asistida por IA”.
El desarrollo y la depuración asistidos por IA claramente no van a desaparecer. Pero por ahora, las herramientas de depuración con IA probablemente se entiendan mejor como asistentes potentes, no como pilotos automáticos confiables. Pueden explicar los seguimientos de la pila, detectar errores de sintaxis y trazar parches candidatos rápidamente. Pero los casos más difíciles —errores lógicos, bases de código complejas y código sensible a la seguridad— siguen exigiendo pruebas, puntos de interrupción y un humano experto que revise los arreglos antes de que se fusione con una base de código.
Acelere la entrega de software con IBM® Bob , su socio de IA para un desarrollo seguro y orientado a la intención.
Desarrolle, despliegue y gestione aplicaciones de IA más rápido con herramientas preparadas para empresas.
Redefina los sistemas heredados con una modernización inteligente de la IA.
1. Smithsonian National Museum of American History, “Log Book With Computer Bug.”
2. JSTOR Daily, “The Bug in the Computer Bug Story.”
3. Khan Academy, Intro to Python
4. Reddit, “What is a Stack Trace“
5. Cambridge Judge Business School, “Research by Cambridge MBAs for tech firm Undo finds software bugs cost the industry $312 billion a year” (2013).
6. Arxiv, ChatDBG: Augmenting Debugging with Large Language Models
7. Github, “Intro to Copilot“
8. Github, “Models Comparison“
9. XAI, “Grok Fast-1”
10. Github, “Meet Copilot“
11. Github, “Secure Code With Copilot Autofix“
12. Arxiv, “Debug Bench”
13. Arxiv, ChatDBG: Augmenting Debugging with Large Language Models
14. Reddit, “SWE Bench is benchmaxxed“
15. Arxiv, “SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?“
16. METR, “Uplift Update“