首页/文章/ 详情

比本地化部署更实在的是搭建自主专业知识库!

3月前浏览325
    知识库的搭建很多同仁觉得网上的pdf上传后解析没有那么准确,甚至有时问条文内容,其回答的内容还出现了一定的幻觉,那这与你所上传的pdf质量关系很大,不同大模型的识别能力是不同的,比如DS,识别文本一位好手,但是如果是扫描件,很难达到我们的要求。
      我们在思考问题时其实我们希望所搭建的专业知识库核心第一是最好本地化,而且轻便,不要占太多内存,最好是免费的;第二我可以更新知识库,自主删减,第三是上传的知识库文件有时质量较差,希望其能在人工复核的辅助帮助下迅速高质量将文件识别出来,不要出现错误的内容。
     路基路面自动化智能化平台智能体正为实现路基路面设计师个人专业知识库的目的和功能而来。除了之前介绍的工具外,本地知识库搭建也是其核心点。

      点击知识管理,其下拉后提示用户“输入文件夹路径”,我们新建一个文件夹如自主知识库,然后地址输入即可,点击右侧设置按钮,匹配成功即可调用自主的知识库。

     但这里就有一个问题了,由于规范和标准等材料我们收集的几乎均为pdf,因此知识库文件夹里面大家都添加的是pdf,一般pdf都是几十兆上百兆,这交给智能体加载效率肯定十分低下,而且有些pdf都是拍照扫描图片,采用普通的大模型识别错误能够占到60%以上,因此我们建立优质知识库的核心是单个知识文件的大小要精简的同时识别后要与其本身内容完全一样。因此我们基于基础文本识别+OCR图片文件识别+LLM大模型辅助修正开发了pdf智能文档解析工具。

       其解析能力对于非扫描图片pdf第一时间识别率(人工不修正)为99%以上,对于扫描图片pdf第一时间识别率(人工不修正)为90%以上,与市面付费程序识别水平基本持平(一般1千页50元),而且转化的md格式相较源文件大大缩小,比如原来50兆的规范识别后仅500多KB。

带水印规范本程序第一时间完全正确识别

解析的md格式源码

解析的预览界面

       本工具自动识别水印,从微 信截图几乎100%识别文字借鉴灵感,识别正确率基本100%。本工具还提供了用户预览+直接修改的功能,用户可以直接点击编辑对照规范标准进行修改,而不是像传统市面程序一样下载md文件后修改,解决了md文件对于公式和表格代码表达形式一般用户无法读懂的核心问题。

       用户自主知识库+RAG增强搜索技术可以完全自主建立属于自己的知识体系,并且智能体优先从自主知识体系进行检索思考问题,避免大模型幻觉的痛点问题!这样的知识库搭建远比单纯的大模型本地化部署更能解决实际专业问题!

网上智能体幻觉问题

       如上图,直接问网上的智能体公路边坡防护设计安全提升工作指引(试行)7.2节是什么,其回答的是监测内容与方法。实际上是边坡的稳定性计算篇章。而我们在建立自主知识库后,答案根本不会出现幻觉!

自主知识库的优势

       注:pdf解析推荐通义大模型,基本操作流程基本一致,配置好API后选择相应的模型即可选择模型文件点击开启即可使用,必要的api调用还是需要花点钱,但10块钱仍然足够!

       左下角点击网站API KEY建立API后在智能体中配置好,推荐通义千问VL PLUS(如果不需要解析pdf建议还是采用DEEPSEEK),打开解析工具后模型配置自动识别主界面,但模型处请填写“qwen-vl-max-latest”,然后拖入或打开pdf文件开始解析即可。

      那接下来就让我们开始智能体之旅吧!


来源:博强路基路面设计
材料
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-05-21
最近编辑:3月前
博强路基路面
硕士 | 公路路基路面... 抬头看路,低头做事
获赞 96粉丝 363文章 150课程 5
点赞
收藏
作者推荐
未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈