Creación de un experimento RAG (vía rápida)
Cree un experimento de generación aumentada por recuperación (RAG) utilizando AutoAI. Cargue una colección de documentos y transfórmelos en vectores que puedan utilizarse para mejorar el resultado de un modelo lingüístico de gran tamaño. Compare conductos optimizados para seleccionar el mejor patrón RAG para su aplicación.
Preparación de las fuentes de datos
Antes de crear un experimento RAG, prepare su colección de documentos y sus activos de datos de evaluación. La recopilación de documentos proporciona contexto para las respuestas a la entrada rápida. Los datos de evaluación son un archivo con ejemplos de preguntas y respuestas que se puede utilizar para medir el rendimiento de los patrones RAG.
Colección de documentos
- Formatos admitidos para la recopilación de documentos: PDF, HTML, DOCX, MD, PPTX, JSON, YAML, XML o texto sin formato
Datos de evaluación
- Formato admitido para el archivo de datos de evaluación: JSON
La carga de datos de evaluación es opcional si tiene instalado en su entorno un modelo de lenguaje de gran tamaño mistral o llama con la función autoai_rag . Puede cargar su propio archivo JSON o seleccionar Generar con LLM para que LLM genere un máximo de 10 pares de preguntas de muestra y respuestas correctas. Puede consultar los datos de evaluación generados una vez finalizado el experimento en Resultados de la evaluación del patrón RAG.
- El uso de un LLM para generar los datos de evaluación utiliza tokens adicionales.
- El LLM que genera los datos de referencia sólo admite el inglés.
Plantilla para el archivo de evaluación JSON
El archivo de datos de evaluación proporciona una serie de preguntas de muestra y respuestas correctas para evaluar el rendimiento del patrón GAR. Utilice este formato para el archivo JSON:
Puedes hacer referencia a archivos que se encuentren en subdirectorios de tu fuente de datos. Todos los identificadores de archivo deben utilizar rutas absolutas con respecto a la raíz del depósito. Por ejemplo, data/doc1.text o reports/2026/summary.txt para una subcarpeta.
Si no utilizas subcarpetas y todos los archivos se encuentran en la misma ruta, puedes seguir refiriéndote a ellos simplemente por su nombre de archivo. No es necesario especificar las rutas de acceso a los recursos de datos del proyecto.
[
{
"question": "<text>",
"correct_answer": "<text>",
"correct_answer_document_ids": [
"<filepath>",
"<filepath>"
]
},
{
"question": "<text>",
"correct_answer": "<text>",
"correct_answer_document_ids": [
"<filepath>",
"<filepath>"
]
},
{
"question": "<text>",
"correct_answer": "<text>",
"correct_answer_document_ids": [
"<filepath>",
"<filepath>"
]
}
]
Para añadir varias respuestas correctas a una pregunta, indique el texto de la respuesta y el ID del documento para cada respuesta correcta. Utilice este formato para múltiples respuestas correctas:
[
{
"question": "Question 1",
"correct_answer": "Correct answer 1 for question 1.",
"correct_answer_document_ids": ["data/folder1/id1a1q1", "data/folder1/id2a1q1"]
},
{
"question": "Question 1",
"correct_answer": "Correct answer 2 for question 1.",
"correct_answer_document_ids": ["data/folder1/id1a2q1", "data/folder1/id2a2q1"]
},
{
"question": "Question 2",
"correct_answer": "Correct answer 1 for question 2.",
"correct_answer_document_ids": ["data/folder1/id1a1q2", "data/folder1/id2a1q2"]
}
]
Por ejemplo, los siguientes son ejemplos de preguntas y respuestas para el patrón que se entrena con la documentación de la biblioteca watsonx.ai Python.
[
{
"question": "What foundation models are available in watsonx.ai?",
"correct_answer": "The following models are available in watsonx.ai: \nflan-t5-xl-3b\nFlan-t5-xxl-11b\nflan-ul2-20b\ngpt-neox-20b\ngranite-13b-chat-v2\ngranite-13b-chat-v1\ngranite-13b-instruct-v2\ngranite-13b-instruct-v1\nllama-2-13b-chat\nllama-2-70b-chat\nmpt-7b-instruct2\nmt0-xxl-13b\nstarcoder-15.5b",
"correct_answer_document_ids": [
"data/folder1/5B37710FE7BBD6EFB842FEB7B49B036302E18F81_0.txt"
]
},
{
"question": "What foundation models are available on Watsonx, and which of these has IBM built?",
"correct_answer": "The following foundation models are available on Watsonx:\n\n1. flan-t5-xl-3b\n2. flan-t5-xxl-11b\n3. flan-ul2-20b\n4. gpt-neox-20b\n5. granite-13b-chat-v2 (IBM built)\n6. granite-13b-chat-v1 (IBM built)\n7. granite-13b-instruct-v2 (IBM built)\n8. granite-13b-instruct-v1 (IBM built)\n9. llama-2-13b-chat\n10. llama-2-70b-chat\n11. mpt-7b-instruct2\n12. mt0-xxl-13b\n13. starcoder-15.5b\n\n The Granite family of foundation models, including granite-13b-chat-v2, granite-13b-chat-v1, and granite-13b-instruct-v2 has been build by IBM.",
"correct_answer_document_ids": [
"data/folder1/5B37710FE7BBD6EFB842FEB7B49B036302E18F81_0.txt",
"data/folder1/B2593108FA446C4B4B0EF5ADC2CD5D9585B0B63C_0.txt"
]
},
{
"question": "What is greedy decoding?",
"correct_answer": "Greedy decoding produces output that closely matches the most common language in the model's pretraining data and in your prompt text, which is desirable in less creative or fact-based use cases. A weakness of greedy decoding is that it can cause repetitive loops in the generated output.",
"correct_answer_document_ids": [
"data/folder1/42AE491240EF740E6A8C5CF32B817E606F554E49_1.txt"
]
},
{
"question": "When to tune a foundation model?",
"correct_answer": "Tune a foundation model when you want to do the following things:\n\nReduce the cost of inferencing at scale\nGet the model's output to use a certain style or format\nImprove the model's performance by teaching the model a specialized task\nGenerate output in a reliable form in response to zero-shot prompts\"",
"correct_answer_document_ids": [
"data/folder1/FBC3C5F81D060CD996489B772ABAC886F12130A3_0.txt"
]
},
{
"question": "What tuning parameters are available for IBM foundation models?",
"correct_answer": "Tuning parameter values for IBM foundation models:\nInitialization method\ninitialization text\nbatch_size\naccumulate_steps\nlearning_rate\nnum_epochs\"",
"correct_answer_document_ids": [
"data/folder1/51747F17F413F1F34CFD73D170DE392D874D03DD_2.txt"
]
},
{
"question": "How do I avoid generating personal information with foundation models?",
"correct_answer": "To exclude personal information, try these techniques:\n- In your prompt, instruct the model to refrain from mentioning names, contact details, or personal information.\n- In your larger application, pipeline, or solution, post-process the content that is generated by the foundation model to find and remove personal information.\"",
"correct_answer_document_ids": [
"data/folder1/E59B59312D1EB3B2BA78D7E78993883BB3784C2B_4.txt"
]
},
{
"question": "What is Watson OpenScale?",
"correct_answer": "Watson OpenScale is a tool that helps organizations evaluate and monitor the performance of their AI models. It tracks and measures outcomes from AI models, and helps ensure that they remain fair, explainable, and compliant no matter where the models were built or are running. Watson OpenScale also detects and helps correct the drift in accuracy when an AI model is in production.",
"correct_answer_document_ids": [
"data/folder1/777F72F32FD20E96C4A5F0CCA461FE9A79334E96_0.txt"
]
}
]
Elegir un almacén de vectores
Debe proporcionar una ubicación para almacenar los documentos vectorizados en una base de datos que se utiliza para almacenar y recuperar contenido para el proceso de preguntas y respuestas. Para obtener más información sobre las opciones de base de datos disponibles, consulte Elegir un almacén de vectores.
- La base de datos Chroma en memoria por defecto es un almacén temporal de vectores para ejecutar el experimento. El índice no persiste más allá del experimento, por lo que no es una buena opción para su uso en producción.
- Conéctese a una base de datos Milvus o configúrela si desea un almacén de vectores permanente. Utilice esta opción si planea desplegar su patrón RAG. Para más detalles, consulte Configuración de una tienda de vectores watsonx.data Milvus
Para conectarse a una tienda de vector Milvus, elija el Milvus tipo de conector genérico, no el conector watsonx.data Milvus, incluso si configura la tienda de vectores Milvus utilizando watsonx.data.
Vea este vídeo para ver cómo crear un experimento AutoAI RAG.
Este vídeo proporciona un método visual para aprender los conceptos y tareas de esta documentación.
Creación del experimento AutoAI RAG
Siga estos pasos para definir y ejecutar un experimento para buscar el patrón RAG óptimo para su caso de uso, utilizando los ajustes de configuración por defecto como fastpath.
En la página de bienvenida de watsonx.ai o en la página Nuevos activos de un proyecto, haz clic en Crear soluciones de IA automáticamente.
Escriba un nombre y una descripción opcional para el experimento, seleccione un tamaño de configuración y haga clic en Crear.
Seleccione Construir una solución RAG como tipo de experimento.
Cargar o conectarse a los datos de recopilación y evaluación de documentos. Seleccione hasta 20 carpetas y archivos de documentos para la colección de documentos. El archivo de datos de evaluación debe ser un único archivo JSON. También puedes utilizar una base de conocimientos ya existente en lugar de subir documentos. Para obtener más información, consulte «Uso de bases de conocimiento en los experimentos RAG de AutoAI ».

Elija dónde almacenar el índice basado en vectores para la colección de documentos.
Especifique el archivo JSON que desea utilizar como datos de referencia para evaluar los resultados del experimento.
Opcional: Selecciona o crea un espacio de implementación donde se implementarán los patrones una vez finalizado el experimento. Si no estableces una carpeta de destino, AutoAI creará automáticamente una carpeta para los patrones.
Opcional: activa la opción «Implementar automáticamente el patrón más eficaz tras la ejecución» para implementar automáticamente el patrón más eficaz una vez finalizado el experimento. Si se configura un espacio de implementación de destino, el patrón superior se implementa automáticamente en él.
Haga clic en Ejecutar experimento para crear los conductos RAG utilizando la configuración predeterminada:
- Métrica optimizada: Optimiza la creación de los patrones RAG para la métrica de fidelidad de respuesta.
- Modelos a considerar: El valor predeterminado de Todos los tipos de modelos considera todos los modelos de cimentación disponibles para generar los patrones GAR.
Los ajustes del experimento son configurables si desea personalizarlo para su caso de uso. Consulte Personalización de la configuración del experimento RAG.
Ver los resultados
Utilice las siguientes herramientas para ver el progreso y revisar los resultados.
A medida que se ejecuta el experimento, un mapa de progreso ofrece una visualización de cómo se crean y optimizan los conductos. Pase el ratón por encima de cualquier nodo para obtener más detalles.

Cuando finalice el experimento, haga clic en Importancia de la configuración para revisar la importancia de cada configuración para crear y clasificar los patrones optimizados.

Revise la tabla de clasificación que muestra las canalizaciones de experimentos, clasificadas según los resultados de la métrica optimizada.

Cuando finalice el experimento, revise la tabla de clasificación que muestra las canalizaciones del experimento, clasificadas según los resultados de la métrica optimizada.

Haga clic en el nombre de una tubería para ver los detalles. Revise la puntuación obtenida por la canalización en las distintas métricas evaluadas con respecto a la pregunta y respuesta de muestra.

Una vez finalizado el análisis, haga clic en Guardar para generar automáticamente activos de cuaderno que podrá utilizar para probar y utilizar el patrón RAG.

Revise y ejecute el cuaderno o cuadernos resultantes para probar o utilizar su patrón GAR. Para más detalles, consulte Guardar un patrón RAG.
Próximos pasos
- Para editar las opciones de configuración, consulte Personalización de la configuración del experimento RAG.
- Para analizar un patrón, consulte los detalles del patrónAutoAI RAG.
- Para guardar y utilizar un patrón RAG, consulte Guardar un patrón RAG.