将提取的文本添加到 RAG 解决方案中
根据您在文本提取请求中配置的文件类型,提取输出的结构和格式有所不同。 您可能需要对结果进行一些后处理,然后才能在 RAG 解决方案中将内容用作接地数据。
您可以将生成的 Markdown 文件转换为文本文件,方法是将文件扩展名从 .md 更改为 .txt。 生成的文本文件包含 Markdown 标记。 如果想移除标签,可以使用解析器库来查找和转换标签。
您可以使用 JSON 处理器库从生成的 JSON 文件中提取文本,并将其存储为纯文本。 例如,以下命令提取文档中所有结构的每个标记的文本,并将文本存储到名为 parsed_output_text.txt 的文件中:
cat output_retail.json | jq '[.all_structures.tokens[].text] | join(" ")' > parsed_output_text.txt
将生成的文件转换为 TXT 文件后,可以通过以下方式将提取的文本用作基础模型提示的上下文信息:
参考 Python 笔记本中的摘录文本。
例如,您可以使用 TXT 文件代替
state_of_the_union.txt文件位于使用 watsonx、Chroma 和 LangChain 回答问题 (RAG) 示例笔记本中。您可以在 Prompt Lab 中使用 TXT 文件作为基础文件。 如需了解更多信息,请参阅将基础模型提示与上下文信息相结合。
Markdown 输出
提取的文本将写入 Markdown 文件,文件名由您在 results_reference.location.file_name 字段中指定。
Markdown 内容可捕捉文档中的结构,如章节和表格。 例如,下图显示了原始 PDF 文件中的表格在提取文本后如何用 Markdown 表示。 其中包含标记表的预览,以显示提取后 PDF 中原始表格的文本保持不变。

JSON 输出
将文本提取到 JSON 文件时,生成的文件包含文档中不同数据结构的详细信息,如章节、段落、表格结构、标记等。
有关如何处理以 JSON 格式提取的文本的更多信息,请参阅解析文本提取生成的 JSON 结构。
后续操作
现在,您可以将精炼提取的文本文件作为 AutoAI RAG 实验的输入,自动生成 RAG 模式。 详情请参阅 AutoAI RAG 文本提取实验编码。