文化产业杂志

生成式检索重塑图书馆OPAC

时间:2026-06-24 09:09:14来源:广西民族大学 文字:全成

  摘要:传统在线公共访问目录(OPAC)具有滞后性和局限性,已无法满足新形势下用户复杂多样的信息需求。近年来,在线检索领域的生成式检索算法不断迭代完善获得飞速发展,从技术层面为OPAC系统进行革新提供了可能。现从原理出发,阐述生成式检索的概念、优势以及需面对的问题;分析其对图书馆OPAC系统的范式革新带来的影响;以现有的实验结果为基础,探讨生成式检索算法在OPAC系统中可能产生的效果;提出关于未来OPAC系统的革新方向和智能升级的建议,为图书馆OPAC系统的升级提供理论参考和实践引导。

  联机公共目录检索系统(OPAC)是用户访问图书馆信息资源的主要入口之一,传统的基于关键词匹配方式的OPAC检索系统存在的问题正逐渐得到关注。人工智能技术的发展和新时代背景下用户对检索系统的更高要求,使得传统的基于关键词匹配方式的检索系统已无法满足用户需求,表现为检索结果相关度不高、详细检索方法难以掌握、不能识别用户的真正意图等。用户在检索过程中需要不断调整优化检索方式才能得到满意的结果,这会影响用户使用的体验感和检索速度。基于深度学习技术研发的生成式检索技术,能够从用户提出的查询语句中进行创造性的重组和延伸,而非仅局限于对已有文档内容进行匹配。相较基于关键词匹配的传统检索系统,生成式检索技术更符合人们的使用习惯,且具有更高的检索准确性和可满足度。目前,多数学者就人工智能赋能信息检索方面开展了研究,虽总结出生成式人工智能在改善图书馆信息检索质量方面的优势[1][2][3],但学界对于生成式检索改善OPAC检索系统的研究仍处于起步阶段。因此,笔者通过深入分析其工作原理和优缺点,结合现有研究成果探讨其可能应用于OPAC系统的方式,并试图推测未来可能的发展趋势。

传统OPAC系统面临的挑战

  传统的OPAC系统使用的是关键词匹配算法,会根据用户在检索时提供的关键词,在系统已建立好的索引基础上,提供用户需要的资料。此种检索模式主要存在以下问题。

  其一,检索结果相关度低。传统的关键词匹配算法一般只关注文字的表层含义,难以真正了解用户的意图,因此会导致检索结果的相关度较低,用户需从大量无关的文档中寻找自己需要的信息。“宽泛匹配”虽然能在一定程度上保证检索结果召回量,但容易产生大量噪声[4]。系统对于语义的理解存在偏差,用户需花费大量时间筛选与自己需求不符的文档。

  其二,用户检索策略复杂。为使搜索结果更加精准,用户需根据专业及检索经验不断改进搜索技巧,需经过多次修改。具体来说,包括加用布尔运算符(AND/OR/NOT)连接关键词;运用截词符扩大检索范围;用主题词或分类号进行精检等。对无检索经验的人来说很难做到这点,因此效率较低;而对有检索经验的人来说,仍需通过不断试错得到正确的检索途径,需付出较高时间成本、耗费大量精力。

  其三,难以理解用户意图。传统的OPAC系统难以理解用户真实的查询意图,无法洞悉用户背后存在的隐性需求和具体的检索背景与上下文信息,造成检索结果不准确。例如,用户查询“机器学习”,传统OPAC系统并不能区分用户的真实检索意图,只能简单粗暴地按照关键词表面意义上的检索方式获取相关信息,这样会造成检索结果精确度较低,需要用户提供大量的信息材料过滤无效检索结果。

  其四,缺乏个性化服务。与传统OPAC系统对所有读者提供统一的检索界面和检索结果服务不同,生成式检索可根据用户对检索相关度的要求、用户的阅读喜好等,定制个性化的检索信息查询平台。由于每个用户感兴趣的内容不同,其浏览记录也必然存在差异,因此应为不同用户个性化展现参考文献。

  其五,元数据质量影响检索效果。OPAC系统的检索效果主要取决于元数据的质量,元数据包括表达文献内容和特性的书名、作者、关键词、摘要、主题词等。如果元数据有错误、有缺失、不符合规范,就会导致检索结果不准确或不完整。因此,提高元数据质量是提升OPAC系统检索的关键。

  上述问题制约着OPAC系统的功能,影响用户的使用体验,难以满足新时代用户日益复杂、不断增长的信息需求。

生成式检索的原理与优势

  生成式检索是一种基于深度学习的信息检索技术,主要是将用户提出的问题通过预训练的语言模型生成与用户需求相关的文件或文件片段。主要有以下几种生成式检索模型。

  RAG(Retrieval-Augmented Generation)模型是利用检索机制从知识库中获取相关信息,再结合用户的查询信息,一起送入生成模块进行答案生成或生成一篇相关文章。

  Seq2Seq模型基于“编码器—解码器”结构将用户查询编码成向量,并利用解码器生成相关的文档或文档片段。

  Transformer模型是以学习用户查询和文档间的关系为目标,并生成相关文档或相关文档片段的模型,采用了自注意力机制。

  与传统的基于匹配的检索方法相比,生成式检索的优势有以下几点。

  一是更强的语义理解能力。通常情况下,传统的基于匹配的检索方式一般通过关键词或向量相似度的方式做相应匹配。这种方法不能直接展现出用户想要达到的语义效果。而通过生成式检索,直接使用BERT、GPT等预训练语言模型就能从大量的语料库中学习大量关于语言的知识以及语义方面的信息,将用户输入的自然语句映射成较为符合系统规则语句。这类模型通过大规模语料库学习了词语之间的关联性、句子结构以及文本内容间的关系,可以较好地体现用户的潜在语义[5]。

  二是生成相关的文档或文档片段。传统检索方式往往会呈现大量与查询相关但间接的结果,需要用户从中自行挑选。但对生成式检索来说,则可根据用户输入的内容提取一段符合其要求的结果,即不需要提供大量间接相关的文档供用户筛选阅读,直接给用户提供其所需信息,从而提高检索效率、提升用户体验。

  三是更强的泛化能力。基于预训练语言模型的生成式检索,能深度学习大量的通用知识,可以回答一些未见过的查询信息。例如,在训练数据中虽未包含有关“新型冠状病毒变异毒株的传播机制”的文件,但生成式检索会借助模型掌握一定的常识,生成与之相关的文档片段信息,从而反馈给用户以供参考。泛化能力强的优点可帮助检索系统适应信息需求的实时变化情况,从而提高检索服务的质量。

  四是更强的鲁棒性。在信息检索过程中,出现错误或歧义是常见情况,传统的检索技术由于易受这些因素影响,致使检索结果的正确性较低。与之相比,生成式检索更具鲁棒性,可以处理查询中的错误或歧义[6]。

  五是支持多模态检索。传统的检索技术主要基于文本进行检索,对其他的数据模态并无效果。生成式检索能够对不同数据模态的信息同时进行检索,让用户获得更好的检索体验。

生成式检索对图书馆OPAC系统范式革新的影响

  随着生成式检索技术的快速发展,图书馆OPAC系统将实现从传统简单的OPAC系统演变为基于新技术支撑的OPAC系统的范式革新。传统的OPAC系统已显落后,其功能难以满足用户日益增长的复杂信息需求,而生成式检索技术正成为OPAC系统升级的重要基础[7]。

  从匹配到生成:传统OPAC系统的原理是将用户的查询词与本馆的馆藏文献索引数据库进行相应匹配。这种方式只适用于简单的关键词式检索,无法准确理解用户的查询需求,也无法处理复杂度高的查询需求,更无法根据需求自动做出相应的检索结果输出。在生成式检索技术中,OPAC系统不再拘泥于匹配模式,开始往生成模式靠拢,即OPAC不再是简单地反馈与用户输入的查询内容相关的几条记录,而是生成特定的答案、摘要,甚至一篇完整的报告,这样极大地提高了OPAC系统的检索效率,提升了用户体验,能帮助用户快速获得所需内容。

  文献摘要生成系统:在浩如烟海的文献资源中,快速了解文献内容至关重要。利用生成式检索技术自动生成文献摘要,可帮助用户快速了解文献内容,从而提高检索效率。生成式检索系统能够分析文献的主要内容、核心观点、研究方法等信息,自动生成简洁明了的文献摘要,帮助用户快速判断文献是否符合自身需求。

  从单次检索到多轮对话:传统OPAC系统只能实现一次检索,用户输入一次查询词只能得到一次检索结果;生成式检索系统支持多轮对话,用户可反复跟OPAC系统交流,不断对自己的问题加以说明和细化,直至得到准确答案。

  从传统元数据到知识图谱:传统的OPAC系统是一种基于书名、作者、关键词等传统元数据的检索方式,但传统元数据存在弊端,如信息不够全面、不能精准描述文献内容、不能反映文献间的关系等。生成式检索能运用知识图谱中的知识更好地理解用户查询意图,提升检索结果的质量和完备性。通过建立知识图谱,将文献与文献、概念与概念、实体与实体的关系及其本身的层次关系等进行结构化并存入数据库,从而展现文献的内容和特点。

  从单用户检索到个性化推荐:与为每位用户提供相同检索界面及检索结果的传统OPAC系统不同,生成式检索系统能根据用户的个人兴趣和爱好等因素生成具有个性化特点的检索服务及检索结果。

生成式检索技术在OPAC系统中的应用前景

  生成式检索技术在OPAC系统中的应用前景,主要包括以下五点。

  一是智能问答系统。传统的OPAC系统以检索为核心功能,用户需输入查询词,在检索结果列表中逐项查找,并人工判断是否为所需文献;基于生成式检索技术构建的智能问答系统,则允许用户以自然语言向OPAC系统提问,只需直接告知问题即可获得解答,无需亲自检索信息。同时,系统并非简单返回相关文档,而是直接解析出目标信息并给出答复。

  二是个性化推荐系统。不同用户的研究方向和关注信息各异,对文献的检索方式也各不相同,传统的OPAC系统难以契合不同用户的需求。基于生成式检索的推荐,能通过算法分析用户喜好和偏好等信息,从而向用户推荐个性化的文档和资料。

  三是文献摘要生成系统。在浩瀚无垠的资料海洋中,能够快速了解一篇文献资料的内容非常重要。利用生成式检索技术自动生成文献摘要,可以帮助用户更迅速地了解文献内容,从而加快检索速度。

  四是查询扩展系统。用户自行检索时,受限于检索用词或提问的准确性不足,常出现检索范围狭窄、结果覆盖率偏低的问题。相较而言,生成式检索可通过自动优化用户提问,有效提升检索结果的覆盖范围与准确率。

  五是多模态检索系统。传统OPAC系统以文本检索为主,难以满足用户跨领域的信息需求。引入生成式检索技术,实现图文、图声等多模态检索,则能帮助用户通过多种方式获取所需内容,从而大幅提升检索效率与准确率[8]。

  生成式检索技术为图书馆OPAC系统的革新提供了全新的思路和机遇。本研究在已有研究成果基础上,从生成式检索的原理、优势、难题及瓶颈等方面着手,探讨其在图书馆OPAC系统中的创新运用,以推动OPAC系统的范式革新,为图书馆提供更好的智能化信息服务。因此,图书馆有必要加强对生成式检索技术的研究与开发,加快OPAC系统的智能化,助推图书馆实现数字化转型与智能化升级。

  教育部产学合作协同育人项目“信息资源管理视角下高校师资培训资源的优化配置与利用研究”(项目编号:2509133656)。

  参考文献:

  [1]裘江南,高双燕,黄榕江,等.AIGC背景下人智认知导向的信息检索范式:基于世界3理论的探究[J].中国图书馆学报,2025,51(01):34-48.

  [2]赵宇翔,付振康,曾鹏翔,等.生成式人工智能驱动下智慧图书馆信息搜索的技术框架及服务模式研究[J].中国图书馆学报,2025,51(05):54-66.

  [3]嵇婷,许磊,周纲.生成式人工智能驱动下图书馆信息检索服务模式的重构研究[J].图书馆建设,2025(06):134-145.

  [4]胡德华,种乐熹,邱均平,等.国内外知识检索研究的进展与趋势[J].图书情报知识,2015(03):93-106.

  [5]徐国虎,董慧.基于语义的数字图书馆推理检索研究[J].中国图书馆学报,2006(03):50-53.

  [6]刘炜,张磊,嵇婷,等.以AI塑形智慧图书馆:基于智能体的下一代图书馆服务平台[J].农业图书情报学报,2025,37(05):15-26.

  [7]徐国虎,董慧.基于语义的数字图书馆推理检索研究[J].中国图书馆学报,2006(03):50-53.

  [8]刘炜,张磊,嵇婷,等.以AI塑形智慧图书馆:基于智能体的下一代图书馆服务平台[J].农业图书情报学报,2025,37(05):15-26.

    作者:全成

  审核:颜宝辉

联系我们|网站介绍|欢迎投稿|杂志订阅|网站声明|

主管:山西出版传媒集团   主办:山西三晋报刊传媒集团     编辑出版:《文化产业》杂志社   投稿邮箱:whcytg@163.com
地址:山西省太原市迎泽区柳巷南路云路街2号 邮编:030000 联系电话:0351-4120686、0351-4120998、0351-4120995
期刊出版许可证丨 国内刊号:CN14-1347/G2 丨国际刊号:ISSN1674-3520丨邮发代号:22-415
晋ICP备2021019266号-1 晋公网安备140105029904671
主管:    山西出版传媒集团   主办:    山西三晋报刊传媒集团     编辑出版 《文化产业》杂志社   投稿邮箱:whcytg@163.com