OctoNews

做 RAG 踩过最多坑的地方不是模型,是文件前处理。

AI 工具技术和认知提升模型部署开源

做 RAG 踩过最多坑的地方不是模型,是文件前处理。

表单、流程图、多栏 PDF 扔进去,出来的文本全是乱的,召回自然差。

有人开源了一个专门解决这个的小工具:Semark。

把 PDF / Office / HTML / 图片转成适合知识库的 semantic Markdown——不只是 OCR,而是尽量保留表格结构、字段关系和语义层级。

基于 MinerU,可接 Ollama 或 OpenAI-compatible VLM/LLM,支持自动分档。

作者说是第一次整理开源项目,但这个方向真的很实用。

github.com/KingsleyOWO/Semark

提到的仓库