将提取的文本添加到 RAG 解决方案中

根据您在文本提取请求中配置的文件类型,提取输出的结构和格式有所不同。 您可能需要对结果进行一些后处理,然后才能在 RAG 解决方案中将内容用作接地数据。

您可以将生成的 Markdown 文件转换为文本文件,方法是将文件扩展名从 .md 更改为 .txt。 生成的文本文件包含 Markdown 标记。 如果想移除标签,可以使用解析器库来查找和转换标签。

您可以使用 JSON 处理器库从生成的 JSON 文件中提取文本,并将其存储为纯文本。 例如,以下命令提取文档中所有结构的每个标记的文本,并将文本存储到名为 parsed_output_text.txt 的文件中:

cat output_retail.json | jq '[.all_structures.tokens[].text] | join(" ")' > parsed_output_text.txt
注意: 该命令使用 jq,这是一个需要单独安装的命令行 JSON 处理器。

将生成的文件转换为 TXT 文件后,可以通过以下方式将提取的文本用作基础模型提示的上下文信息:

Markdown 输出

提取的文本将写入 Markdown 文件,文件名由您在 results_reference.location.file_name 字段中指定。

Markdown 内容可捕捉文档中的结构,如章节和表格。 例如,下图显示了原始 PDF 文件中的表格在提取文本后如何用 Markdown 表示。 其中包含标记表的预览,以显示提取后 PDF 中原始表格的文本保持不变。

三张截图,第一张显示 PDF 文档中的表格,第二张显示提取为 markdown 格式的表格文本,第三张显示表格的预览图

JSON 输出

将文本提取到 JSON 文件时,生成的文件包含文档中不同数据结构的详细信息,如章节、段落、表格结构、标记等。

有关如何处理以 JSON 格式提取的文本的更多信息,请参阅解析文本提取生成的 JSON 结构

后续操作

现在,您可以将精炼提取的文本文件作为 AutoAI RAG 实验的输入,自动生成 RAG 模式。 详情请参阅 AutoAI RAG 文本提取实验编码

了解更多