法律和经济科学

实证分析 | 《红楼梦》后四十回的作者是高鹗吗?

发表时间:2025-06-13 08:53作者:阳李

核心内容导读:以《红楼梦》前八十回和后四十回的文本为分析对象,探究前八十回和后四十回在用词偏好、语义关系、写作逻辑等方面呈现出的规律,并通过深度学习二者的计算相似性。最终计算出:《红楼梦》前八十回和后四十回的相似度为:96.34%。

基于关键词、语义、文本分类等深度学习方法之应用,从该研究范式和角度而言,《红楼梦》后四十回的作者有较大的可能性为曹雪芹,而非高鹗或者其他人。

一、导

《红楼梦》后四十回一般认为是高鹗续写的,但这一说法在学术界存在一定争议,也有观点认为高鹗是整理者,续作者可能是程伟元与高鹗共同完成,或是其他无名氏,或是曹雪芹所著。

(一)高鹗续写点依据

在相当长一段时间里,人们普遍认为《红楼梦》后四十回是高鹗续写的。这一观点主要基于程伟元、高鹗在程甲本《红楼梦》序言中的说法。程伟元称“然原本目录一百二十卷,今所藏只八十卷,殊非全本。即间称有全部者,及检阅仍只八十卷,读者颇以为憾。不佞以是书既有百二十卷之目,岂无全璧?爰为竭力搜罗,自藏书家甚至故纸堆中无不留心,数年以来,仅积有廿余卷。一日偶于鼓担上得十余卷,遂重价购之,欣然翻阅,见其前后起伏,尚属接笋,然漶漫不可收拾。乃同友人细加厘剔,截长补短,抄成全部,复为镌板,以公同好,《红楼梦》全书始至是告成矣”。高鹗在序中也表示“予闻《红楼梦》脍炙人口者,几廿余年,然无全璧,无定本。向曾从友人借观,窃以染指尝鼎为憾。今年春,友人程子小泉过予,以其所购全书见示,且曰:‘此仆数年铢积寸累之苦心,将付剞劂,公同好,子闲且惫矣,盍分任之?’予以是书虽稗官野史之流,然尚不谬于名教,欣然拜诺,正以波斯奴见宝为幸,遂襄其役。工既竣,并识端末,以告阅者”。从这些表述来看,似乎高鹗参与了后四十回的整理和续写工作。

文学风格与主题契合度分析:从文学风格上看,后四十回在语言运用、人物塑造等方面与前八十回有一定的连贯性。例如,在人物对话上,依然保持着生动、细腻、富有个性的特点;在情节发展上,也遵循了前八十回所设定的大致脉络。在主题方面,后四十回延续了前八十回对封建家族兴衰、人生无常等主题的探讨,如贾府的最终败落、宝黛爱情的悲剧结局等,都与前八十回的主题相呼应。

然而,也有学者对高鹗续写说提出质疑。他们认为,程伟元、高鹗的序和引言中并未明确提及续写,而是强调了整理和修订的工作。此外,后四十回与前八十回在写作风格、人物塑造等方面存在差异,且脂砚斋评语提到的情节在后四十回中几乎未出现,这些都不支持高鹗续写说。

(二)整理者说及其他观点

整理者说:随着研究的深入,有学者提出高鹗可能主要是整理者而非续作者。他们认为,程伟元和高鹗在程甲本序言中所说的“截长补短,抄成全部”,可能更多地是指对已有的后四十回残稿进行整理和修补,而不是完全由高鹗重新创作。例如,一些学者通过对不同版本《红楼梦》的对比研究,发现后四十回中存在一些与前八十回在细节上相互呼应的内容,这些内容可能是原本就存在的,只是经过了整理和润色。

其他观点:近年来,又有学者提出后四十回可能是程伟元与高鹗共同完成,或者后四十回的续作者另有其人,高鹗只是参与了整理和出版工作。甚至有观点认为后四十回是无名氏所续,高鹗和程伟元只是进行了整理和传抄。

(三)无名氏续写说

该观点认为《红楼梦》后四十回是由一位不知名的作者续写完成的,因此署名为“无名氏”。

脂砚斋在评语中提到了许多《红楼梦》后八十回的情节,但这些情节在后四十回中几乎未出现。这可能表明后四十回的作者可能并未见过脂砚斋的评语,或者并未按照评语中的提示进行创作,从而支持了无名氏续写说。

(四)曹雪芹原著说

该观点认为《红楼梦》一百二十回均为曹雪芹所作,后四十回只是曹雪芹的残稿,经过程伟元、高鹗的整理而成。

后四十回与前八十回在情节、人物等方面存在紧密的联系,许多情节和人物命运在前八十回中已有伏笔。这种紧密的联系表明后四十回可能是曹雪芹原著的一部分,从而支持了曹雪芹原著说。部分学者对曹雪芹的创作习惯进行研究,认为他有可能在创作过程中不断修改和完善作品,后四十回可能是他未完成的残稿。这种创作习惯为曹雪芹原著说提供了一定的依据。

目前,学界关于《红楼梦》后四十回作者的争议仍然存在,尚未形成共识。各种观点都有一定的文献支撑,但都存在一些不足之处。未来的研究需要进一步深入挖掘文献,结合更多的历史证据和文学分析,以期形成更为准确的结论。同时,随着新的文献和证据的不断发现,这一争议也有望得到进一步的解决。

二、初步的观察

基于关键词、语义、文本分类等深度学习方法之应用,本文试图对《红楼梦》后四十回与前八十回进行深度的文本分析。

首先,通过绘制词云图,看红楼梦前八十回和后四十回的高频词是否有显著区别。

(一)《红楼梦》前八十回:前20个高频词:

宝玉: 2533

什么: 1020

贾母: 770

那里: 680

凤姐: 677

一面: 672

如今: 661

众人: 623

出来: 605

姑娘: 586

两个: 583

知道: 581

说道: 568

起来: 560

王夫人: 554

这里: 544

奶奶: 528

老太太: 522

自己: 511

只见: 510

图片

(二)《红楼梦》后四十回:前20个高频词:

宝玉: 1241

什么: 595

那里: 498

王夫人: 461

贾母: 460

老太太: 453

没有: 445

凤姐: 423

说道: 411

这里: 395

起来: 395

知道: 392

听见: 381

姑娘: 365

老爷: 343

如今: 342

太太: 336

怎么: 329

出来: 327

自己: 325

图片

从词云图粗略的看,前八十回和后四十回似乎在高频词方面存在诸多相似之处。

三、基于TF-IDF提取《红楼梦》的重要关键词

TF-IDF(Term Frequency-Inverse Document Frequency)是自然语言处理中最基础且最重要的文本表示技术之一,用于评估词语在文档中的重要程度。TF-IDF 的核心思想是:一个词语在文档中出现的频率越高(TF),同时在所有文档中出现的频率越低(IDF),则该词语对该文档的代表性越强。通过这种方式,TF-IDF 能够过滤掉常见的无意义词汇(如“的”“是”等),突出对文档内容有代表性的关键词。

例如:"量子"在物理学论文中高频出现(高TF),但在日常文本中罕见(高IDF)→ 重要关键词;

"的"在所有文档中都高频出现(高TF但低IDF)→ 不重要。

TF-IDF的代表性论文为:Spärck Jones, K. (1972). "A Statistical Interpretation of Term Specificity and Its Application in Retrieval". Journal of Documentation, 28(1), 11-21.Salton, G., & Buckley, C. (1988). "Term-Weighting Approaches in Automatic Text Retrieval". Information Processing & Management, 24(5), 513-523.

TF-IDF由两部分组成:TF(词频) 和 IDF(逆文档频率),最终通过 TF × IDF 计算得到。

计算公式为:

图片

一个词的 TF-IDF 值越高,说明它对当前文档越重要,但在整个语料库中越独特。

可以求解出:

前八十回的部分 TF-IDF 值:

[('宝玉', 0.11252848577130284),

('贾母', 0.038034272251147874),

('凤姐', 0.0338367964848182),

('王夫人', 0.027607312858350552),

('一面', 0.02520721035898131),

('老太太', 0.024164967017195164),

('凤姐儿', 0.023947359675461504),

('奶奶', 0.023749342239817565),

('什么', 0.02317557203838559),

('众人', 0.02309109133857414),

('姑娘', 0.022226737472910957),

('那里', 0.0217764499412661),

('平儿', 0.021715901160248043),

('太太', 0.02126160528971303),

('如今', 0.02112340259315461),

('你们', 0.02040171288778095),

('袭人', 0.019890698217509842),

('贾琏', 0.01971673950693374),

('说道', 0.01867845735833514),

('只见', 0.018521516961535422),

('一个', 0.01823494953488897),

('我们', 0.01797342787596142),

('探春', 0.017484877708226463),

('晴雯', 0.01722543074283605),

('丫头', 0.016972766247522073),

('出来', 0.01683821317537233),

('宝钗', 0.016416334313617012),

('湘云', 0.016340043553142572),

('黛玉', 0.01576939118653383),

('这里', 0.015506501084061),

('这会子', 0.0154588167294453),

('林黛玉', 0.015392970587410727),

('两个', 0.015370332194534098),

('不知', 0.015351245427508948),

('他们', 0.014869788301313813),

('知道', 0.014708044422687375),

('鸳鸯', 0.014144297975229194),

('刘姥姥', 0.014142834904463327),

('起来', 0.014130882053609876),

('进来', 0.013450205160524442),

('姐姐', 0.013298433247790759),

('咱们', 0.013264900004030742),

('二人', 0.013206831283527957),

('薛姨妈', 0.013143576053651664),

('只得', 0.01296292342021868),

('贾珍', 0.012835349927209815),

('怎么', 0.012556228050131093),

('出去', 0.012490353273191751),

('丫鬟', 0.01242280084163244),

('大家', 0.012071224880105423),

('东西', 0.012040694988882576),

('这个', 0.011839121829014752),

('听见', 0.011734651828082887),

('不是', 0.011660137204680034),

('尤氏', 0.0115105730522953),

('自己', 0.011467728612353586),

('告诉', 0.011384153987474808),

('香菱', 0.011372711179538813),

('周瑞家', 0.011270467369250761),

('一时', 0.01120133142998586),

('只管', 0.011134426347848852),

('姊妹', 0.011048046697533157),

('今儿', 0.011042763611613647),

('银子', 0.011003284474830368),

('罢了', 0.010815868665296012),

('邢夫人', 0.0104774194273497),

('这样', 0.0103736395905

后四十回的 TF-IDF 值:

[('宝玉', 0.11431139788238148),

('王夫人', 0.047632762185865436),

('贾母', 0.047112124224143806),

('凤姐', 0.04383604933519118),

('老太太', 0.043481485690318705),

('贾琏', 0.03427315852926446),

('那里', 0.03306724250670374),

('太太', 0.030291232107397145),

('老爷', 0.030145789800317117),

('听见', 0.02980748020087462),

('奶奶', 0.029750811448314693),

('姑娘', 0.028705256865610925),

('什么', 0.028030944118057666),

('说道', 0.02802366679447321),

('宝钗', 0.026110052101118435),

('黛玉', 0.025675380365964232),

('贾政', 0.02504763231240474),

('薛姨妈', 0.024847733950854413),

('二爷', 0.024679662590498332),

('紫鹃', 0.02448790343146355),

('这里', 0.023345462319030418),

('如今', 0.022660995890049794),

('平儿', 0.021779742393233655),

('只见', 0.02115939113065339),

('袭人', 0.02115526076739794),

('起来', 0.020666589309461386),

('知道', 0.020575733991256454),

('你们', 0.020307281676667153),

('进来', 0.02013720482897983),

('怎么', 0.019204840437594864),

('众人', 0.019135782614296094),

('出来', 0.018870301995596528),

('回来', 0.018525815761030205),

('没有', 0.01829549068841216),

('我们', 0.017647950536817458),

('只得', 0.01758359559275818),

('过来', 0.016954304829363255),

('鸳鸯', 0.01655747111125157),

('告诉', 0.016509753147922156),

('外头', 0.01640044504853856),

('的话', 0.016301812119561502),

('一个', 0.016225116213182414),

('丫头', 0.01598719157341262),

('心里', 0.015781866811675274),

('贾政道', 0.015490011927155971),

('咱们', 0.015351019934454587),

('贾赦', 0.015315896184027842),

('自己', 0.0151227348130506),

('不知', 0.014990389004300712),

('不敢', 0.014434418569109136),

('不好', 0.014081852630405347),

('探春', 0.013151995340903146),

('东西', 0.013050200488287877),

('不是', 0.013014286017698414),

('里头', 0.012757114798465785),

('那边', 0.01269266616191539),

('答应', 0.012637297728789508),

('只是', 0.01235614536432845),

('好些', 0.012348891317279728),

('贾芸', 0.01231587528200177),

('邢夫人', 0.012227310302361814),

('一回', 0.012156572834154373),

('一面', 0.012133066559242404),

('这样', 0.011690811933966294),

('袭人道', 0.011368500260309326),

('小丫头', 0.011348276526720906),

('姐姐', 0.011327

TF-IDF值来看,前八十回和后四十回似乎也具有较强的相似性。

四、基于Word2Vec模型和余弦相似度求解前八十回和后四十回的相似度

Word2Vec是Google2013年提出的词嵌入技术,核心思想是"相似上下文中的词语应有相似语义表示"。Word2Vec通过分布式假设和神经网络优化,将词语映射到低维向量空间,捕捉了丰富的语义关系。其核心在于Skip-Gram/CBOW 算法与负采样/层次 Softmax 优化技术 的结合,使得大规模语料的高效训练成为可能。代表性文献包括《Efficient Estimation of Word Representations in Vector Space》、《Distributed Representations of Words and Phrases and their Compositionality》等等。

Word2Vec可以将每条文本中所有词的词向量求平均,进而可得到文本的向量。

Word2Vec 基本架构如下:

图片


余弦相似度(Cosine Similarity)则可以计算多个文本向量之间的相似度。

余弦相似度通过计算两个向量在多维空间中的夹角余弦值,衡量它们的方向一致性(即语义相似性)。余弦相似度的结果在 [−1,1] 之间,值越接近 1 表示越相似。计算公式为:

图片

其中:A⋅B 是向量点积。∥A∥ 和 ∥B∥ 是向量的欧几里得范数(长度)。

文档相似度计算路径如下:

图片


借助一个预训练的词向量模型,该模型训练所使用的语料包括 26GB 的百科类文本(如中文百度百科、维基百科等结构化知识库),13GB 的新闻语料(如新闻网站、论坛等),以及229GB的小说文本(如网络小说、文学作品),总数据量超 268GB(26+13+229),属于大规模预训练。

以《红楼梦》前八十回和后四十回的文本为分析对象,探究前八十回和后四十回在用词偏好、语义关系、写作逻辑等方面呈现出的规律,并通过深度学习二者的计算相似性。将《红楼梦》前八十回和后四十回的文本转换为数值向量,并计算所有关键词向量的平均值。

最终测算出:《红楼梦》前八十回和后四十回的相似度为:96.34%。

基于关键词、语义、文本分类等深度学习方法之应用,从该研究范式和角度而言,《红楼梦》后四十回的作者有较大的可能性为曹雪芹,而非高鹗或者其他人。

图片

五、可能的不足之处

本文是基于大模型和深度学习的文本分析法对红楼梦进行的初步探究,可能还存在诸多不足之处,例如,尚未建立完整的尤其是针对古代文学的停用词词库和语料库,关键词的针对性筛选有所不足,仅采用TF-IDF算法从文本中提取最具代表性的关键词,没有对全文文本进行完整分词,亦没有使用其他类似模型进行对比,例如BERT和Doc2vec。