免费的工具,往往有最昂贵的代价

Antique books, compass, key, globe, bottle, and bird nest on wooden desk

隐私、版权与供应商黑箱

图书馆可以制定严密的员工规则,却仍在采购环节失去控制。馆员按要求保护每一条咨询记录,数据库商却可能在一次升级中改变查询处理方式;工作人员填写AI使用申请,办公平台内置的模型却已经默认开启。

制度若只管人、不管平台,图书馆会出现一种荒诞的守法:对自己要求很严,对真正掌握模型和数据的人几乎没有要求。

一家图书馆准备使用公共生成式AI起草活动文案,通常不会召开采购论证会。工具免费,注册方便,似乎也没有部署系统。只要不输入敏感信息,问题好像不大。

麻烦就在“好像”二字。

免费工具仍有服务条款,仍会处理提示词、上传文件、设备信息和使用记录。所谓敏感信息也不会自动变红。读者的研究主题、病患寻找的资料、求职者的简历、尚未公开的地方文献,在不同业务中可能以普通文本的面貌出现。馆员复制进去时,数据已经离开了图书馆能够控制的环境。

一句提示词,可以装下多少秘密

图书馆保护读者隐私,并不只是保守姓名和借阅记录。参考咨询内容能够暴露健康状况、政治兴趣、法律纠纷、财务困难和个人身份。即便删除姓名,问题组合也可能重新指向具体个人。

生成式AI又增加了新的数据形态:提示词、对话历史、上传文件、反馈评价、账户信息。这些数据是否用于训练,保存多长时间,由哪些子处理商接触,往往取决于产品版本和合同。消费者免费版、机构版和本地部署版可能完全不同。

所以,“不要输入敏感信息”只能是第一层提醒。图书馆还要提供数据分类、批准工具和安全替代方案。否则,员工被告知要谨慎,却没有办法完成工作。

错误为什么会借到图书馆的信用

模型编造一本不存在的书,个人用户可能一笑置之;同样的书名若出现在图书馆咨询答复中,性质便不同。公众信任的对象不是模型,而是图书馆。

这种信用借用解释了为什么对外内容需要主题合格的人员复核。复核不能只看语句通顺,还要回到来源。尤其在地方史、医学、法律、政策和少数语言领域,模型流畅的错误比笨拙的错误更危险。

信息质量风险也会进入元数据。自动生成的主题词和摘要一旦批量写入目录,偏差可能长期积累,并通过联合目录继续传播。人工抽检、错误回溯和版本记录因此比一句“结果仅供参考”更有用。

版权争论远不止训练数据

AI与版权的公共争论常集中在模型训练是否合法。图书馆还面对一些更琐碎、也更迫近的问题。

馆员能否把受许可保护的数据库全文交给外部模型概括?供应商的AI摘要是否改变了数据库原有使用许可?AI生成或实质性辅助生成的图书要不要入藏?合成语音与无障碍制作如何区分?自动生成的书评、封面和元数据应当怎样标注?

国际图联2025年版权与AI声明强调,在维护创作者权利的同时,也要保护知识获取、研究和图书馆依法履职的空间。[1] 这意味着图书馆既不能把版权简化为“技术公司可以随便训练”,也不宜把所有机器辅助行为视作同一种侵权。

馆藏政策尤其需要克制。以“检测出AI即拒绝”为标准,看似坚决,实际依赖并不可靠的检测器,还可能误伤辅助翻译、残障创作和正常编辑。更稳妥的判断仍是质量、准确性、原创性、责任主体、专业评价与社区需要。

最难治理的AI,往往看不见

公共聊天工具至少有一个清楚的入口。嵌入数据库、发现系统、办公软件和安全设备的AI则可能随着升级自动出现。用户点击“智能摘要”,图书馆未必知道问题送到哪个模型;厂商更换模型,机构也未必收到足够通知。

多伦多公共图书馆的政策把公共AI、嵌入既有软件的AI以及自行开发或采购的私有系统一并纳入范围。西雅图公共图书馆同样明确,免费软件和软件即服务不能绕过审批。[2][3]

这两项规定戳破了一种便利的幻觉:没有单独购买AI,就没有作出AI采购决定。事实上,接受默认更新也是决定,只是决定权悄悄移到了供应商手中。

采购合同是政策的硬骨头

图书馆若只写员工守则,不改采购流程,治理就会一头重、一头轻。供应商至少应回答以下问题:

  • 输入和生成内容是否用于训练;
  • 数据保存地点、期限和子处理商;
  • 模型、用途或条款变化是否提前通知;
  • 是否提供关闭AI或使用非AI模式的选择;
  • 能否导出、纠正和删除数据;
  • 发生安全或质量事件后多久通报;
  • 是否接受独立审计或联盟评估;
  • 合同终止后如何证明数据已经处理。

这些问题未必都能得到满意答案。但拒绝回答本身就是风险信息。

小型图书馆常说自己没有力量与大型厂商谈判。这是事实,却不是结束。地区联盟、专业协会和国家级机构可以共建供应商问卷、示范条款和产品评估档案。几十家图书馆分别询问同一家公司,既浪费时间,也让对方逐个消解压力。

环境和劳动不能只写在附录里

2026年美国图书馆协会指南把能耗、水耗、电子废弃物、数据标注和内容审核劳动纳入采购视野。[4] 这些议题对单馆很难核实,却不该因此消失。

图书馆未必能计算每次问答耗费多少水,但可以要求供应商披露可比较数据;未必能检查全球内容审核劳动,却可以询问外包链条和劳动标准。政策不是万能测量仪,它至少能决定哪些成本不再被当作不存在。

当产品免费时,最先要问的不是省了多少钱。要问谁提供了数据,谁承担了核查,谁失去了选择,以及图书馆将哪一部分公共信用交给了产品。

有些账单从不寄到财务处。它们寄给读者、馆员、创作者和后来处理事故的人。

采购条款解决不了全部问题。系统上线以后,核查、解释和纠错仍由人完成。于是还要追问:所谓效率,到底减轻了谁的劳动,又把责任交给了谁?


主要资料

  1. IFLA. (2025). Realising Potential, Supporting Users: IFLA Statement on Copyright and Artificial Intelligence. https://www.ifla.org/news/realising-potential-supporting-users-ifla-statement-on-copyright-and-artificial-intelligence/
  2. Toronto Public Library. (2025). Artificial Intelligence Policy. https://tpl.ca/policies-and-terms-of-use/artificial-intelligence-policy/
  3. The Seattle Public Library. (2025). Library Use of Artificial Intelligence. https://www.spl.org/about-us/policies/library-use-of-artificial-intelligence
  4. American Library Association. (2026). Guidance on the Use of Artificial Intelligence in Libraries. https://www.ala.org/tools/standards-and-guidelines/guidance-use-artificial-intelligence-libraries


留下评论