行业资讯

  • Home
  • 大型模型开始收集纸质书籍,背后的原因引人深思

大型模型开始收集纸质书籍,背后的原因引人深思

2026-09-29 8146

最近,在东京的神田神保町,这个广受赞誉的古书店街,书店经营者们迎来了一批奇特的“买家”。这些买家并不像传统读者,也不具备明显的人类特征。他们在购买书籍时完全不考虑作者名气、封面设计和书籍状况,只要是带字的书籍,统统一扫而空。无论是旧的地方志、法律案例集,还是医学手册和农业统计小册,所有书籍都被扫走,甚至某些店铺一天就出售上百本,累计销量更是过千册。追踪发现,这些书籍最终都被发往一个跨国物流中转站,原来是大型科技公司在为其算力需求进行大规模“纸质书抢购”。

人工智能的发展曾依赖于庞大的网络数据,但现今的数据资源日渐枯竭。硅谷的AI模型在短时间内消耗了大量信息,依赖于网络数据的模型正面临“数据墙”危机。未来,我们可能会看到高质量文本数据的彻底耗尽,而当前互联网充斥着大量低质量信息,这将使得AI的训练结果变得毫无逻辑,甚至出现能力下降的现象。面对即将枯竭的数据来源,那些未被数字化的纸质书籍成为了新的研究对象。

为了快速获取高质量书籍内容,硅谷的科技公司采取了极致高效的方法。他们并不是传统意义上的翻阅和扫描书籍,而是将纸质书籍通过工业手段进行拆解和数字化处理。书本被送入工业切纸机,迅速化为单页,随后利用高速扫描仪转化为数字格式,最终实现数据的结构化提取。这一过程展现了科技如何将实体知识转化为可用于训练的数据。

特别是日本的二手书籍因其高质量和独特的内容,成为科技巨头的“目标”。日本出版业发达,印刷工艺优良,令人满意的排版使得现代光学字符识别技术能够以极高的准确率识别这些文本。此外,许多来自过去的地方志和法律文档等资料在网络上几乎找不到,提供了独特的社会与法律知识,为研究提供了宝贵的资源。

发表评论