📰 [程序员] 分享一些在 AI 解析中常见的问题,以及工具区别
[程序员] 分享一些在 AI 解析中常见的问题,以及工具区别
上周我分享了一个自己做的小项目,已经在 Github 上拿下 1000star 了(到这周是 1500+了),后面有人问我,觉得我做的东西跟 MinerU 好像啊,是不是在重复造轮子? https://www.v2ex.com/t/1219941?p=1#reply2
所以今天分享一下在 AI 时代做解析可能会遇到的一些问题,以及工具之间的区别。
首先叠个甲啊,MinerU 确实是一个很优秀的文档解析工具,它能把 PDF 里的文字、标题、表格、图片等内容提取出来,并转换成 Markdown 。
但问题在于:解析成 Markdown ,并不等于文档已经能被 Agent 理解。
你拿到一份 Markdown 后,通常还要:
把它切成 Chunk ,扔进向量库,然后让 Agent 或 RAG 系统去检索。
听起来很顺,但真正做过的人都知道,坑就在这里。
一份复杂 PDF 原本有章节、有层级、有表格、有图片、有跨页引用。解析成 Markdown 之后,这些结构信息会变弱;再经过切片,每个 Chunk 更像是被切下来的孤立文本片段。
它可能不知道自己属于哪一章,前后文是什么,旁边那张表格在说明什
查看原文 → ↗
上周我分享了一个自己做的小项目,已经在 Github 上拿下 1000star 了(到这周是 1500+了),后面有人问我,觉得我做的东西跟 MinerU 好像啊,是不是在重复造轮子? https://www.v2ex.com/t/1219941?p=1#reply2
所以今天分享一下在 AI 时代做解析可能会遇到的一些问题,以及工具之间的区别。
首先叠个甲啊,MinerU 确实是一个很优秀的文档解析工具,它能把 PDF 里的文字、标题、表格、图片等内容提取出来,并转换成 Markdown 。
但问题在于:解析成 Markdown ,并不等于文档已经能被 Agent 理解。
你拿到一份 Markdown 后,通常还要:
把它切成 Chunk ,扔进向量库,然后让 Agent 或 RAG 系统去检索。
听起来很顺,但真正做过的人都知道,坑就在这里。
一份复杂 PDF 原本有章节、有层级、有表格、有图片、有跨页引用。解析成 Markdown 之后,这些结构信息会变弱;再经过切片,每个 Chunk 更像是被切下来的孤立文本片段。
它可能不知道自己属于哪一章,前后文是什么,旁边那张表格在说明什
查看原文 → ↗
🤖 AI 技术资讯机器人