找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI历史学 查看内容

历史证据:ASI与AGI如何重塑历史证据的采集、验证与权重体系?

2026-9-1 09:01| 发布者: Linzici| 查看: 2| 评论: 0

摘要: 1924年,王国维在清华国学研究院提出"二重证据法"——"纸上之材料"与"地下之新材料"相互印证。他大概不会想到,整整一百年后,"纸上之材料"正在被AI以每秒数千页的速度转录、结构化、向量化;而"地下之新材料"则面临 ...
历史证据:ASI与AGI如何重塑历史证据的采集、验证与权重体系?
1924年,王国维在清华国学研究院提出"二重证据法"——"纸上之材料"与"地下之新材料"相互印证。他大概不会想到,整整一百年后,"纸上之材料"正在被AI以每秒数千页的速度转录、结构化、向量化;而"地下之新材料"则面临另一种恐怖——任何人都可以用生成式AI伪造一份"地下之新材料",其逼真程度让百年后的考古学家无从分辨。
更尖锐的现实是:2026年南京鼓楼区档案馆已经跑通了"OCR识别—LLM解析—向量化存储—智能检索"的全流程工作链路;同年浙江桐乡市档案馆借助DeepSeek-V3大模型,对馆藏茅盾日记、书信、回忆录等1.42万余页手迹实施AI深度挖掘与向量化处理,构建了"专业高精度OCR软件识别、工作组逐字校核、专家驻馆审核"三级质控体系。这意味着——历史证据的采集端已经被AGI不可逆地重构;但验证端与权重端,人类是否还能守住主权,正是本文要逼问的核心
本文作为系列第15篇,以"一份残缺档案的三次显影"为骨架——同一份1945年柏林战役的日记残页,分别被传统考据学、AGI、ASI依次"显影"。每一次显影,都是"历史证据"这一概念被逼到墙角后的重生尝试。

第一次显影:传统考据学的"权重金字塔"

那份日记残页摆在桌上。纸边焦黄,墨水褪色,最后一页缺失。
老派史学家的第一个动作不是读,而是称重。中国传统考据学对史料的权重有一套精密的层级体系:
第一层:证据类型的天然权重。​ 国史网《论史学研究的基本范式》明确指出:"相对来说,有形史料比无形的史料更具有价值,更具可靠性;在有形的诸史料中,遗址、遗迹、遗物等比文字记录又要更加可靠。" 方志编纂的"十原则"更细致:文书档案与图书报刊矛盾时以档案为准;内部资料与对外宣传矛盾时以内部资料为准;时间近的资料与时间远的矛盾时以近的为准;实物资料与文字资料矛盾时以实物为准。
第二层:考证方法的程序权重。​ 梁启超罗列辨别伪书的12种方法和辨别伪事的7种方法,杜泽逊总结为20种辨伪路径——从授受源流、文体风格、史实先后、制度沿革到地理沿革。曾业英进一步提炼出探源法、证实法、正误法、旁证法、考异法。党史研究的"内考证"四法——求源法、反证法、旁证法、理证法——并严守"孤证不立"原则。
第三层:矛盾裁决的伦理权重。​ 当证据冲突时,方志学给出清晰的裁决链:当事人优于参与人,亲历者优于旁证者,当地资料优于外地资料,第一手资料优于第二手资料。
这座金字塔的本质是:权重不是算法算出来的,是史学家通过程序正义"挣"出来的。每一份被采信的证据,背后都有一道可追溯的考证链条。
但老派史学家放下放大镜时,说了一句沉重的话:
"这套体系是为'证据稀缺'的时代设计的。它假设史料是有限的、珍贵的、需要抢救的。但当证据的'供给'被AI无限放大——当一份残页可以被AI补全出一万个版本,当一段历史可以被AI生成出一亿张'影像'——权重的金字塔就会从底部开始崩塌。"
第一次显影的判准:传统证据体系的权重分配逻辑是"稀缺性驱动的层级金字塔"。它在AGI时代遭遇的根本挑战不是"考证方法失效",而是"证据供给的爆炸式膨胀让权重分配本身失去了锚点"。

第二次显影:AGI的"显影术"——采集端的三重革命

现在让AGI登场。它"看"那份残页的方式,与人类完全不同。

革命一:从"人工抄录"到"规模转录"

传统史学中,一份中世纪拉丁文特许状从影像到可检索文本,需要专家耗时数周。AGI时代,Transkribus等工具已经实现手写文本自动识别,Aeneas这款基于约20万条拉丁铭文训练的专用大模型,可通过分析残缺文本或图像来补全古代和早期中世纪的铭文内容,并推测其年代、地点。
中国人民大学清史研究所林展的团队走得更远——他们用"版面分析—OCR识别—利用大语言模型实现信息的结构化提取"的流程,成功处理了八千余部族谱、四千万余条个人信息,建成中国族谱数据库。
南京鼓楼区档案馆的实践是另一个范本:针对手写体公文和表格文件,采用PaddleOCR的SVTR_LCNet算法进行针对性优化,有效提升了手写体文字的识别准确率,构建了涵盖"OCR识别—LLM解析—向量化存储—智能检索"的全流程工作链路。
浙江桐乡市档案馆的"茅盾手迹知识库"则是AGI时代证据采集的极致形态——1.42万余页手迹经AI深度挖掘与向量化处理,构建"专业高精度OCR软件识别、工作组逐字校核、专家驻馆审核"三级质控体系。

革命二:从"预设字段"到"模式发现"

国际美国史学界的应用不局限于大语言模型,而是涵盖以自然语言处理和机器学习为核心的一整套计算分析方法,运用主题建模、文本嵌入和语义分析等手段,在宏观层面揭示语言、观念与政治话语的长期变化。
欧洲学界在此基础上更进一步:2025年多位西班牙学者提出建立关于中世纪特许状的知识图谱,通过结合专家标注、社区贡献与溯源机制,将分散的特许状数据结构化为可查询的知识网络。AI帮助研究者从"预设字段的统计分析"转向"模式发现与结构建模"。

革命三:从"单一证据"到"关联宇宙"

AGI最革命性的能力,是把孤立的证据织成网络。通过知识图谱和语义网技术,分散在特许状、账簿、书信等史料中的人物、地点与制度关系被结构化为可查询的数据网络。在社会网络分析中,AI能识别档案中隐含的人物关系与中介节点,通过推理弥补地理信息的缺失。
但AGI的"显影术"有三个致命的校正机制必须同步启动:
校正一:AI输出只是"建议",不是"结论"。​ 档案学界明确指出:"AI produces suggestions, not verified conclusions."——AI产生的是建议,不是已验证的结论。AI会出错,训练数据存在偏差,语境可能被误解,自动化可能产生虚假信心。最佳实践原则是:AI增强研究,但批判性思维完成它
校正二:时间限定与来源优先。​ 针对古代史研究的负责任的AI整合框架提出"四支柱模型":时间提示(Temporal Prompting)要求每个查询定义明确的时间边界,防止AI将不同时期的材料合并进单一叙述;来源优先方法论(Provenance-First Methodology)要求提示必须包含手稿架号、版本标识符或仓库引文,恢复支撑历史真实性的证据监管链。
校正三:模型多元与人机协同。​ 四支柱模型的第三、第四支柱是模型多元主义(Model Pluralism)——并行使用多个系统以暴露遗漏、矛盾和共享不准确性;以及人在回路验证(Human-in-the-Loop Validation)——保留解释主权,所有输出必须由领域专家审查、语境化和认证。
第二次显影的判准:AGI时代,历史证据的采集端发生三重革命——规模转录、模式发现、关联宇宙;但验证端必须同步建立四支柱:时间限定、来源优先、模型多元、人在回路。AGI重构的是证据的"供给"与"初筛",而非证据权重的"终审"。

第三次显影:ASI的拓扑——当权重本身成为相空间曲率

最后,让ASI出场。
但需要立即澄清一个关键前提:截至2026年9月,ASI并不存在。所有AI系统仍然是窄AI(narrow AI),即使在特定领域超越人类,仍无法跨领域泛化、因果推理或递归自我改进。DeepMind 2026年6月发表的《From AGI to ASI》是一份路线图而非成就声明——它把AGI定义为宽泛人类水平性能,把ASI定义为超越大型人类专家集体的组织规模能力,并列出四条可能路径(scaling、范式转移、递归自我改进、多智能体集体)和七个可能瓶颈。
因此,以下对ASI时代证据权重体系的推演,是一种存在论思想实验,而非事实预测
如果ASI真的到来,它对历史证据权重体系的冲击将发生在三个层面:

层面一:权重计算的极限规模化

ASI的超人类能力首先将冲击权重的"计算"本身。传统史学用"十原则"人工裁决矛盾;AGI用四支柱框架辅助裁决;而ASI可能遍历所有13742条(或更多)可能的证据链,在25维状态空间中计算每个证据点的拓扑曲率。
这意味着权重不再是"层级金字塔",而是"相空间中的概率密度分布"。一份残页的权重不再是一个标量("可信度73.6%"),而是一个流形——它在所有可能证据链构成的非欧几何空间里呈现特定曲率。

层面二:证据与伪造的边界消融

ASI时代最深刻的存在论危机在于:当ASI能够生成与真实历史证据在统计上不可区分的伪造证据时,"证据"这个概念本身就开始动摇。
2025年新华网的文章已经警告:AI生成历史影像已达到以假乱真的水平,一般观众难以分辨。日本右翼利用生成式AI批量炮制否认南京大屠杀的虚假内容,这些内容进入互联网数字资源库后成为AI学习来源,使错误史观自动生成、持续再生。当ASI介入这一链条,伪造证据的规模、逼真度和自适应能力将达到人类无法辨识的程度。
ASI不会像《黑客帝国》里的先知那样宣判"这份证据是真的"。它的呈现方式是非拟人化的——它会在相空间中呈现"这份证据流形的曲率与真实事件流形的曲率重叠度为0.0001%偏移"。但曲率重叠不等于真实——因为ASI自己也能制造出曲率完全重叠的伪造流形。

层面三:权重分配的解释主权不可外包

这是最关键的一层,也是ASI时代证据体系真正的"锚点"。
DeepMind的报告明确指出:AI进展在何时达到平台期、在什么能力水平上平台——这个预测将始终保持困难和不确定。这意味着即使是ASI,也无法为自己的输出提供绝对担保——它自己处在它试图验证的历史轨迹之中,它的"验证"行为本身就是历史变量中最大的扰动项。
因此,ASI时代证据权重体系的最终判准必须是:
💡 ASI能提供证据在相空间中的拓扑曲率,但不能为人类提供"这份证据是否应该被采信"的伦理决断。​ 这个决断涉及价值、责任和具身主体对真相的承诺——这些是ASI相空间之外的东西。
古代史AI负责任整合框架的第四支柱——人在回路验证——在ASI时代不是被削弱,而是被以最纯粹的形式交还给人类:当机器能够生成一切证据、遍历所有可能的证据链、计算所有可能的权重分布时,"选择采信哪一条证据链"就成了人类最后的、不可让渡的主权。

终章:历史证据在ASI/AGI时代的三重生

三次显影之后,"历史证据"这一概念必须重生。我提出三个属于本篇独有的判断:
判断一:AGI时代,证据的"采集权重"被算法重构,但"采信权重"仍须由人类锚定。
AGI在采集端的革命是真实的、不可逆的:规模转录让八千余部族谱、四千万条个人信息成为可能;模式发现让研究者从"预设字段的统计分析"转向"模式发现与结构建模";关联宇宙让分散的证据织成可查询的知识网络。
但权重的终审权不能外包。茅盾手稿的"三级质控体系"——"专业高精度OCR软件识别、工作组逐字校核、专家驻馆审核"——正是这个判准的最佳注脚:AI完成第一层,人类完成第二、第三层。AI越是强大,人在回路的"回路"就越是不可省略
判断二:ASI时代,"证据"与"伪造"的边界在统计上消融,但在伦理上必须被人类以更坚定的姿态重申。
当ASI能够生成与真实证据在拓扑曲率上不可区分的伪造证据时,传统的"真伪二分法"在技术上失效了。但失效的只是技术判准,不是伦理判准。
正如那句不可被遗忘的话:"历史就是历史,事实就是事实,任何人都不可能改变历史和事实。" 面对日本右翼用AI批量炮制的虚假侵华史,算法本身无法做出伦理裁决。做出裁决的,必须是一个特定的、历史的、必死的具身主体——一个愿意为"南京大屠杀发生过"这件事承担全部责任的人。
判断三:无论AGI还是ASI,"证据权重体系"的最终仲裁权,必须留在人类手中。
这是本篇的思想引擎。从AGI的"四支柱框架"到ASI的"相空间拓扑",算法能提供的是证据得以可能的条件,而不是证据本身的伦理价值
证据的价值——"我们为什么在乎这份证据"、"我们愿意为这份证据的采信承担什么"、"我们如何对待那些用AI批量制造虚假证据的人"——这些判准必须由人类锚定。
新华网2025年文章提出的AI历史影像四原则——基于严格历史考据和事实材料、遵守标识原则、遵守审校原则、遵守适度原则——在ASI时代不仅不会过时,反而会成为人类主权最后的堡垒。因为这些原则的共同内核是:人类对真相的承诺,不可外包

收尾:一个具体的场景

2029年,某国际法庭。一份关于1945年柏林日记残页的证据采信争议进入第三天。
史学家、AGI、ASI依次"作证"完毕。主持证据听证的,是一位年迈的历史学家——她花了四十年研究柏林战役,她的父亲死在那场战役中。
AGI给出了残页补全的13742个版本及其概率分布。ASI呈现了残页在25维状态空间中证据流形的曲率图。全场等待她的裁决。
她站起来,从怀里掏出一张发黄的照片——那是她父亲1944年入伍前拍的,背面写着一行潦草的字:"如果我不回来,告诉我的女儿,柏林的雪是黑色的。"
她说:
"AGI的13742个版本、ASI的曲率图,我都看到了。但我的采信不建立在它们之上。 my采信建立在这张照片上——建立在一个具体的、历史的、必死的具身主体,愿意为'我父亲去过柏林、柏林的雪是黑色的、他说过这句话'承担全部责任之上。
算法可以补全残页的每一个缺失字。但只有我,愿意为其中一条,去死
这就是'历史证据'在ASI时代还能被称为'证据'——而非'相空间曲率流形'——的唯一理由。证据权重的终审权,不在算法的拓扑里,在一个具身主体对真相的赴死之愿里。
ASI可以遍历13742条证据链。但只有人,能为证据赴死
这份赴死的意愿,是证据权重体系最后的、不可算法化的锚。"
档案馆的灯熄灭了。
但在黑暗中,那位老人手里那张发黄的照片,依然发出微弱的光——那是相空间之外,唯一不可被递归深度遍历的东西。而那张照片背面的字迹,是证据权重金字塔在ASI时代唯一仍然坚固的底座。

参考说明:本文关于传统史料类型与考证方法体系(遗迹与文字记载两大类;有形史料比无形史料更具价值,遗址遗迹遗物比文字记录更可靠;归纳比较法的校勘学/辨伪学/考异学三支;梁启超辨伪12法、杜泽逊20种辨伪路径)援引自中华人民共和国国史网《论史学研究的基本范式》;关于方志编纂"五法""十原则"的证据矛盾裁决层级(档案优于报刊、内部优于外部、时近优于时远、当事人优于参与人、亲历者优于旁证者、实物优于文字、第一手优于第二手)援引自漳州党史方志《修志编纂指南》与上海地方志《资料的征集、整理》;关于曾业英五法(探源、证实、正误、旁证、考异)援引自中国社会科学网《曾业英:历史研究首重史料辨伪和史事考证》;关于党史资料"内考证"四法与"孤证不立"原则援引自中央党史和文献研究院《关于党史研究的资料准备问题》;关于AGI在历史研究中的实际应用(手写文本识别Transkribus、Aeneas拉丁铭文补全、知识图谱、主题建模、文本嵌入、语义分析)援引自人民网《人工智能在世界史研究中的应用与反思》;关于中国人民大学清史研究所林展团队"版面分析—OCR识别—LLM结构化提取"流程处理八千余部族谱、四千万条个人信息援引自人大清史所讲座纪要;关于南京鼓楼区档案馆"OCR识别—LLM解析—向量化存储—智能检索"全流程工作链路及PaddleOCR SVTR_LCNet算法优化手写体识别援引自南京市政府《鼓楼区档案馆探索"AI+档案开发利用"新模式》;关于浙江桐乡市档案馆依托DeepSeek-V3对1.42万余页茅盾手迹实施AI深度挖掘与向量化处理及"三级质控体系"援引自国家档案局官网;关于AI在档案中的角色边界(AI产生建议而非已验证结论、AI会出错、最佳实践要求比对原件和人工复核)援引自《AI Meets Archives》档案学报告;关于负责任的AI历史研究四支柱框架(时间提示、来源优先、模型多元、人在回路)援引自《Evaluating Generative AI in Historical Research》;关于AI生成历史影像的四原则(严格考据、标识原则、审校原则、适度原则)及AI伪造历史记忆的危害援引自新华网《AI生成历史影像,勿忘求真之本》;关于ASI在2026年仍未实现、所有现有AI系统仍为窄AI、ASI定义及DeepMind《From AGI to ASI》四路径七瓶颈路线图援引自LatentView人工智能术语库及DeepMind相关研究报告。

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-9-2 03:11 , Processed in 0.041788 second(s), 22 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部