AI生成的书籍增长速度超过读者需求
Tech
AI
Publishing
Creator Economy
Copyright

AI生成的书籍增长速度超过读者需求

一项14,419本书的研究发现,AI重度小说的销售份额在增加,而每本书的收入在下降。因果关系的故事不那么确定。

Uygar DuzgunUUygar Duzgun
Jul 28, 2026
更新於 2026年8月2日
19 min read

要理解AI生成的书籍对市场的影响,不要再问平均一本书是否好。

更强的问题是供应是否增长得比读者关注和收入更快。一份2026年7月的工作论文报告了这一模式,样本包含14,419本自出版的类型小说电子书:与2023年第一季度相比,到2026年第一季度,季度销售的书籍数量增长了19.2倍,而单位销售增长了7.3倍,收入增长了8.9倍。检测到大量AI文本的书籍平均销售表现较差,但随着数量的增加,它们的销售和排名份额却在上升。

这表明存在供应冲击。这并不证明AI导致了每一次下降,也不证明每本被标记的书籍都使用了AI,或者低成本小说让读者处于更糟的境地。第二篇经济学论文提出了一个重要的反论点:更多含有AI的书籍可能通过满足小众需求来增加适度的消费者价值,即使每本书的平均使用量下降。

市场可以同时稀释作者收入并扩大读者选择。

读者水平: 高级。本文区分了测量结果、基于模型的估计、法律解释以及作者、出版商和平台的实际决策。

目录

最新的AI书籍研究测量了什么

生成性AI淹没并稀释了书籍市场,发布于7月22日并于7月26日修订,研究了从2023年1月到2026年3月发布的自出版类型小说。研究人员将完整的书籍文本与截至6月29日的每日亚马逊销售数据进行了匹配。

该分析使用了由一家主要出版商维护的专有面板。论文称,较大的面板覆盖了约500,000个亚马逊电子书标识符,代表了至少95%的每日电子书单位销量。其研究样本包括经过市场排名、类型和文本可用性过滤的14,419个标题。

研究人员将每本书分成章节,去掉前言和后记,并通过Pangram 3.3处理文本。他们将标题分为三个类别:

未检测到AI文本:没有分析窗口被标记。
轻度检测到AI文本:超过0%且不超过25%的窗口被标记。
大量检测到AI文本:超过25%的窗口被标记。

这些标签描述了检测器的输出。它们并未揭示使用了哪个模型,作者是否披露了这一点,编辑发生了多少,或是否是人类撰写了文本。论文测试了替代阈值,但没有检测器将作者身份转变为观察到的事实。

该研究随后比较了销售、消费者总收入、排名位置、作者产出、Kindle Unlimited曝光率和独特短语重叠。其90天的发布窗口使得较旧和较新的发布群体更具可比性。

这种设计非常有用,因为它结合了完整文本和交易记录。它仍然是观察性的。最安全的解读是:该研究测量了与稀释一致的市场模式,并排除了几种简单的解释;它并未识别出AI采用的干净因果效应。

AI生成的书籍销售低于其目录份额——但仍然重要

检测到大量AI文本的书籍占样本的20.0%,但在发布窗口的单位销售中仅占12.1%,在收入中占11.3%。未检测到AI文本的书籍占62.9%的标题,71.7%的销售和72.5%的收入。

检测文本类别书籍份额销售份额收入份额
------:---:---:
未检测到AI文本62.9%71.7%72.5%
轻度检测到AI文本17.1%16.2%16.2%
大量检测到AI文本20.0%12.1%11.3%

平均而言,大量AI标题的表现不佳。该类别并未保持商业上的无关性。

到2026年第一季度,任何检测到AI文本的标题占观察到的销售的36.6%和构建的前25名排名的38.5%。仅大量AI类别就占17.5%的销售和18.7%的这些排名。论文还记录了一小部分高收入者:其15本最高收入的大量AI标题在测量期间每本至少产生了220,000美元的总消费者收入。

这些数字并未确立作者利润。总收入在平台佣金、广告、生产成本、税收、退款和其他扣除之前。它们确立了“读者将忽视所有这些”并不是一个可辩护的市场假设。

平均质量和整体影响是不同的变量。低成本生产者不需要每次发布都成功。它可以发布许多尝试,学习哪些封面和小众市场能够转化,并保留少量达到规模的作品。相关单位从一本书转变为一个作品组合。

供应增长速度超过销售和收入

最明显的结果是标题增长与市场增长之间的差距。

2023年第一季度到2026年第一季度发布的书籍、销售标题、收入和单位销售的指数增长
2023年第一季度到2026年第一季度发布的书籍、销售标题、收入和单位销售的指数增长

*说明:研究样本中2023年第一季度到2026年第一季度的指数变化。发布的目录是累积的;销售标题、单位销售和收入是季度流量。来源:Chakrabarty等(2026)。*

到2026年第一季度:

累计发布的目录是其2023年第一季度水平的38.35倍;
每季度销售的标题是其早期水平的19.21倍;
季度收入是其早期水平的8.91倍;
季度单位销售是其早期水平的7.30倍。

累计目录和季度流量并不是相同的度量,因此38.35的数字不应被比较为每本发布的书籍在该季度都竞争相等。逐项比较的季度仍然显示出核心不平衡:销售标题的增长速度是收入的两倍多,单位销售的增长速度是2.6倍多。

论文随后使用固定的发布窗口来比较发布群体。每个销售标题的平均发布窗口收入从2023年的20,134美元下降到2025年的17,312美元,下降了14%。对于未检测到AI文本的书籍,收入从23,877美元下降到19,739美元,下降了17.3%。在所有书籍中,八个类型群体中的六个群体的销售标题收入下降,而在未检测到AI的群体中则有八个群体中的七个群体出现了下降。

这很重要,因为它解决了一个组成反对意见。市场平均值可能会下降,仅仅是因为大量低销售的AI书籍进入了分母。未检测到AI的群体下降表明变化也影响了大量AI类别之外的书籍。

曝光模式指向同一方向。构建的前25名位置中未检测到AI的份额在低曝光类型月份中为87.8%,在高曝光月份中为62.8%。在Kindle Unlimited重度类型中,未检测到AI的书籍在销售上对大量AI标题的领先优势小了8.5个百分点,收入上小了8.4个百分点。

亚马逊表示,Kindle Unlimited的版税来自每月的全球基金,并取决于每本书的标准化阅读页面份额。这创造了一个明确的共享池。该研究在KU重度类型中的更强稀释模式符合这一机制,但并未证明Kindle Unlimited导致了这一差异。

为什么弱平均质量并不阻止稀释

创意市场分配的不仅仅是金钱。它们还分配搜索可见性、推荐位置、评论关注、观众时间和编辑筛选。

即使一本新书什么都不卖,它也可能会带来小的发现成本:

搜索或推荐系统必须对其进行排名;
读者必须检查或跳过它;
竞争标题向下移动或获得更少的印象;
适度和质量系统吸收更多的量;
出版商和作者花费更多来传达信任。

这种影响在数千个发布中累积。这就是为什么生产规模独立于平均产品质量而重要。

研究发现,在385个观察到的署名身份中,有287个在继续发布大量AI标题后增加了每月产出。74.5%的比例是基于继续在该类别中发布的作者。这并不是所有作家的采用效应:在更广泛的事件时间面板中,824个身份中只有311个高于产出增长对角线。

推薦閱讀

成本方面有助于解释这种不对称。AI可以压缩草拟时间,但并不使生成变得免费。更多的产出仍然消耗推理能量、审查时间、资产工作、平台容量和读者注意力。更广泛的成本结构在额外AI产出的资源成本中进行了讨论。当每次额外尝试的成本足够低时,生产者可能理性地接受平庸的平均表现。

推薦閱讀

质量仍然难以定义。销售奖励适合度、包装、时机、价格、促销和现有受众以及散文。对开放和封闭模型的单独分析显示了为什么创意质量取决于评估目标。市场研究可以测量读者购买的内容;它无法将文学价值简化为收入。

读者价值反论点

市场稀释并不意味着消费者没有获得价值。

2026年5月修订的NBER工作论文AI与创意产品的数量和质量考察了一个更广泛的亚马逊电子书市场。它使用了一个分层样本,包含超过330,000个发布,代表了2020年至2025年间约1000万本电子书,以及跨八个子类别的479,000本书的普查。

其主要质量代理是使用:经过年龄调整的读者评分数量,经过估计销售验证,并补充销售排名和星级评分检查。这是一个需求测量,而不是对文学价值的判断。

论文报告了三个复杂简单崩溃叙事的发现:

每月电子书发布数量从2022年到2025年底几乎增加了三倍;
每本书的平均使用量下降,标记为含有AI的书籍平均使用量较低;
较大的目录增加了中等使用书籍的绝对数量,并未取代在LLM时期之前活跃的作者的发布活动。

作者校准了一个嵌套-logit需求模型,并估计AI书籍在2025年提高了消费者剩余约7%。该估计依赖于模型的替代结构和观察到的使用捕捉消费者效用的假设。这不是直接的调查结果,也不测量作者福利、搜索成本、文化价值或长期市场质量。

这两篇书籍市场论文都可能是正确的。更多的小众产品可以提高读者找到特定情节或组合的机会。同样的扩展可以降低每本书的收入,并使创作者的发现成本更高。

视角潜在收益潜在损失
---------
读者更多组合、更快供应、未满足的小众市场更高的搜索成本、不确定的来源、重复的目录
作者较低的生产成本、更多实验每本书的收入降低、发现更困难、模仿压力
平台更多库存和参与度适度、排名、披露和信任成本
出版商更快的测试和辅助工作流程品牌风险、权利不确定性、稀缺性减弱

分配决定了谁受益。对整体消费者剩余的积极估计并不能补偿预期收入下降的特定作者。

私人AI小说揭示了什么——以及它没有揭示什么

已发布的电子书只是AI小说的一种途径。AI Fiction in the Wild,修订于6月23日,研究了来自WildChat数据集的573,453个英语对话,这些对话是在2023年4月至2024年5月通过免费的GPT-3.5和GPT-4接口收集的。

作者使用了一个词汇表和一个o4-mini分类器,然后手动检查了300个对话的随机样本。小说分类器在作者的共识标签下达到了97%的精度和94%的召回率。它将195,271个对话(34%)分类为涉及小说。粉丝小说在小说子集中占49%,而一小部分重度用户产生了大量活动。

这支持了在私人聊天中对即时、定制、重复和小众小说的需求信号。它并未测量已发布书籍的需求。

WildChat用户选择了一个公共研究接口,而不需要OpenAI账户。样本可能会过度代表技术用户、重度用户、边界测试和寻求免费服务的人。研究人员无法观察生成的故事是否被分享、购买、修订成书籍或在对话之外阅读。

经济上的区别很重要:

私人生成将读者和生产者合并为一个人。
市场出版要求一个未知的读者在替代品中选择作品。

AI可以满足第一种用例,而不在第二种情况下产生销售。这有助于解释为什么AI小说的需求可以是真实的,而每本已发布标题的平均收入却在下降。

论文公开提供其分类材料和数据参考。其伴随库对于审计定义和重现分析非常有用。库的可用性增强了过程透明度;但并未使基础的WildChat人群具有代表性。

版权和检测使市场故事复杂化

7月的市场研究增加了一个挑衅性的文本结果。在前50名畅销书中,检测到大量AI文本的书籍在少数现有书籍中发现的稀有五个或更多单词表达的覆盖率为45.0%,而在4.7万亿标记的网络快照中缺失。相应的未检测到AI的组测量为37.7%。

在大量AI的前200名中,稀有表达的覆盖率在每十倍收入增加时上升了7.6个百分点。该斜率在统计上显著,*p* = .001,但与未检测到AI组比较的交互作用在* p * = .063时边际。

这并不证明特定段落是从特定书籍中复制的。整体短语重叠可能反映训练数据、类型惯例、引用、共同来源材料、检测器选择或其他途径。论文本身表示,分析无法确立侵权。

一项单独的预注册研究,读者更喜欢基于版权书籍训练的AI输出而非专家人类作家,显示了质量上限可能变化的原因。28名MFA训练的读者和516名大学教育的普通读者完成了10,920次盲对比评估,评估了以50位获奖作家的风格撰写的人类和AI摘录。

在普通的上下文提示下,MFA读者强烈偏好人类摘录。在对完整作品进行特定作者微调后,测试的ChatGPT输出在写作质量和风格忠实度上平均逆转了这种偏好。微调输出也更常规地逃避了测试的两个AI检测器。

该研究涵盖了最多450字的摘录,而不是完整的小说。其报告的生成成本不包括人类引导、编辑、长篇连贯性工作和出版。它在异常丰富的作者特定训练下测试模仿,而不是普通消费者提示。结果表明,检测器的准确性和感知质量可以随着训练和编辑而变化——这并不是预测AI小说将取代作者的预言。

这种区别符合AI音乐检测工作流程中的一个实用规则:检测器输出是证据,而不是事实真相。

亚马逊KDP当前的内容指南要求出版商在书籍包含AI生成的文本、图像或翻译时通知亚马逊。它不要求对AI辅助工作的披露,出版商仍然对知识产权和质量合规负责。公共指南描述了对亚马逊的披露;它并未承诺面向读者的标签。

美国版权局的生成AI训练报告将市场替代、市场稀释、许可和公共利益视为单独的考虑。它还表示,公平使用分析仍然是事实特定的。销售相关性、检测器得分或短语重叠统计不能解决该法律测试。

证据未能证明的内容

当前证据支持的结论比7月论文的标题更为狭窄。

它并未证明因果关系

书籍市场研究观察了曝光、销售和群体变化。类型需求、疫情时代行为、广告成本、定价、订阅动态、平台排名变化和作者进入可能同时发生。曝光梯度和未检测到AI的群体下降加强了稀释的解释,但没有随机分配识别AI效应。

它并未观察到作者收入

收入数字是总消费者支出。Kindle Unlimited页面阅读未在专有面板中与购买分开。笔名可以将一个生产者分成多个署名。没有一项研究提供净作者利润的清晰分布。

它并未验证披露

研究人员表示,在他们可用的数据中,没有一本样本书披露了AI的使用。KDP的披露规则涉及提供给亚马逊的信息。缺失的公共标签并不是作者未能通知平台的证据。

它并未将检测转化为作者身份

Pangram报告的验证结果并不是对整个书籍语料库的标记真实测试。编辑、翻译、公式化或模型特定的写作可能表现不同。跨阈值的稳健性降低了对一个截止点的敏感性;它无法消除系统检测器错误。

它并未测量整个书籍市场

7月的研究主要集中在通过亚马逊销售的自出版类型小说电子书。传统出版、非小说、印刷、听书、图书馆、直接销售和其他平台可能具有不同的经济学。

作者、出版商和平台的决策框架

不要将决策简化为“使用AI”或“禁止AI”。测量每一方可以控制的变量。

对于作者:优化读者保留,而不是发布数量

跟踪每个发布群体至少:

广告和生产成本后的每本书收入;
样本到购买的转化率;
可用时的完成或标准化页面阅读率;
重复读者和系列延续;
退款、低评分和质量报告率;
每个保留读者的编辑小时数。

在扩展之前设定停止规则。如果输出增加,而保留的读者、每小时编辑的利润或系列延续下降,则更多发布正在放大弱适配。

在保持差异化判断的地方使用AI辅助:研究组织、一致性检查、可访问性审查或受控构思。保留源材料、模型使用、编辑和权利决策的来源记录。这些记录不会解决每个法律问题,但它们使披露和纠正成为可能。

操作原则与使用AI而不抹去作者自身判断相同:定义人类必须仍然拥有的决策,然后测试工作流程是否保留了这些决策。

对于出版商:将产出与投资组合价值分开

评估AI辅助项目与同一类型、价格、作者阶段和营销水平的人类创作基线。报告中位数和分布,而不仅仅是总发布。

要求:

权利和来源记录;
指定人类编辑责任;
长篇连贯性和原创性检查;
收购前的市场重叠审查;
发布后的群体经济学。

更快的手稿管道如果收购、编辑、定位和发现仍然是瓶颈,则价值不大。

对于平台:在供应冲击下测试发现质量

数量限制和披露字段仅解决了部分问题。随着目录供应增长速度超过读者会话,排名系统应进行压力测试。

有用的平台措施包括:

每本销售标题的印象;
第一次有意义的参与时间;
预览后的放弃;
重复或近重复集群的大小;
跨生产者身份的可见性集中度;
按来源类别的投诉和退款;
推荐曝光后的读者满意度。

将“未知来源”与“人类创作”分开。缺失或剥离的元数据并不是人类创作的证据。在摄取、适度和推荐系统中保留源披露、转化历史和置信水平。

结论

AI生成的书籍不需要在平均水平上超过人类书籍就能重塑出版。

最新的市场证据显示出供应冲击:远更多的标题竞争销售、收入和排名位置,而这些增长速度较慢。每本销售标题的收入下降延伸到未检测到AI文本的书籍,而高曝光类型显示出最强的损失。这些模式与稀释一致。

它们并不是因果裁决。更广泛的市场数据也表明,较大的目录可以创造适度的读者价值,尤其是针对小众需求。私人小说生成显示出一些读者希望获得出版商无法有效提供的组合。

实际测试是分配性的:谁从额外的多样性中受益,谁支付发现和质量成本,以及哪些指标在目录扩展之前揭示了交易?

常见问题

AI生成的书籍在亚马逊KDP上被允许吗?

是的。亚马逊KDP要求出版商在书籍包含AI生成的文本、图像或翻译时通知亚马逊。它不要求对AI辅助工作的披露。出版商仍然对知识产权和质量合规负责。

AI生成的书籍有利润吗?

有些是的。在这项14,419本书的研究中,大量AI标题的收入份额小于其目录份额,但一小部分达到了有意义的商业规模。总收入并不是作者利润,平均结果并不能预测特定书籍。

AI检测器能证明一本书是AI写的吗?

不能。它估计文本是否符合学习到的模式。检测器可以支持调查或市场层面的分析,但它不能单独确立作者身份、披露、复制或侵权。

申诉检查

申诉证据状态资格
---------
销售标题增长19.21倍,而季度单位销售增长7.30倍,收入增长8.91倍得到7月市场论文的支持在研究样本内索引;观察性;发布的目录是累积的
大量AI标题占样本的20.0%,但收入占11.3%得到7月市场论文的支持“大量AI”意味着超过25%的文本窗口被Pangram标记
每本销售标题的收入从2023年到2025年下降了14%得到7月市场论文的支持在固定的90天发布窗口内的总消费者收入,而不是作者收入
AI书籍在2025年提高了约7%的消费者剩余NBER论文中的基于模型的估计依赖于嵌套-logit校准和使用作为效用代理
WildChat的34%的英语对话涉及小说得到WildChat论文的支持自愿公共接口样本;并不代表所有读者或书籍购买
微调的AI摘录在测试的偏好研究中优于人类摘录在该实验设置中得到支持短摘录、作者特定完整作品微调和盲偏好——而不是完整小说或销售
KDP要求披露AI生成的内容,但不要求AI辅助内容的披露得到当前亚马逊文档的支持披露是给亚马逊的;公共页面并不承诺面向读者的标签
证据证明AI导致市场稀释不支持当前市场设计是观察性的,无法隔离每个竞争原因

来源

Chakrabarty, T., Liu, X., Ginsburg, J. C., and Dhillon, P. — 生成性AI淹没并稀释了书籍市场,arXiv,修订于2026年7月26日。
Reimers, I., and Waldfogel, J. — AI与创意产品的数量和质量:LLM是否促进了有价值书籍的创作?,NBER工作论文34777,修订于2026年5月。
Gupta, N., Antoniak, M., and Walsh, M. — AI Fiction in the Wild,arXiv,修订于2026年6月23日。
Chakrabarty, T., Ginsburg, J. C., and Dhillon, P. — 读者更喜欢基于版权书籍训练的AI输出而非专家人类作家,arXiv,修订于2026年3月17日。
亚马逊Kindle直接出版 — 内容指南,检查于2026年7月28日。
亚马逊Kindle直接出版 — Kindle Unlimited的版税,检查于2026年7月28日。
美国版权局 — 版权与人工智能,第三部分:生成AI训练,2025年5月。
Gupta, N., Antoniak, M., and Walsh, M. — AI Fiction in the Wild伴随库,检查于2026年7月28日。