
点击知识管理,其下拉后提示用户“输入文件夹路径”,我们新建一个文件夹如自主知识库,然后地址输入即可,点击右侧设置按钮,匹配成功即可调用自主的知识库。
但这里就有一个问题了,由于规范和标准等材料我们收集的几乎均为pdf,因此知识库文件夹里面大家都添加的是pdf,一般pdf都是几十兆上百兆,这交给智能体加载效率肯定十分低下,而且有些pdf都是拍照扫描图片,采用普通的大模型识别错误能够占到60%以上,因此我们建立优质知识库的核心是单个知识文件的大小要精简的同时识别后要与其本身内容完全一样。因此我们基于基础文本识别+OCR图片文件识别+LLM大模型辅助修正开发了pdf智能文档解析工具。

其解析能力对于非扫描图片pdf第一时间识别率(人工不修正)为99%以上,对于扫描图片pdf第一时间识别率(人工不修正)为90%以上,与市面付费程序识别水平基本持平(一般1千页50元),而且转化的md格式相较源文件大大缩小,比如原来50兆的规范识别后仅500多KB。


图带水印规范本程序第一时间完全正确识别

图解析的md格式源码

图解析的预览界面
本工具自动识别水印,从微 信截图几乎100%识别文字借鉴灵感,识别正确率基本100%。本工具还提供了用户预览+直接修改的功能,用户可以直接点击编辑对照规范标准进行修改,而不是像传统市面程序一样下载md文件后修改,解决了md文件对于公式和表格代码表达形式一般用户无法读懂的核心问题。
用户自主知识库+RAG增强搜索技术可以完全自主建立属于自己的知识体系,并且智能体优先从自主知识体系进行检索思考问题,避免大模型幻觉的痛点问题!这样的知识库搭建远比单纯的大模型本地化部署更能解决实际专业问题!


图网上智能体幻觉问题
如上图,直接问网上的智能体公路边坡防护设计安全提升工作指引(试行)7.2节是什么,其回答的是监测内容与方法。实际上是边坡的稳定性计算篇章。而我们在建立自主知识库后,答案根本不会出现幻觉!

图自主知识库的优势
左下角点击网站API KEY建立API后在智能体中配置好,推荐通义千问VL PLUS(如果不需要解析pdf建议还是采用DEEPSEEK),打开解析工具后模型配置自动识别主界面,但模型处请填写“qwen-vl-max-latest”,然后拖入或打开pdf文件开始解析即可。

