从统计到逻辑与因果——关于AI计算物理本质与物理AI实现的探索
[摘要] 当前基于不同模态的数据大规模训练AI算法的研究范式,在技术验证阶段取的成功,展现出巨大商业价值的可能性。但是在AI计算逐渐进入商业化的阶段,出现幻觉、安全等一系列问题,导致不少场景落地困难、也缺少公信力,所以业界又提出物理AI的概念。本文用全新视角和范式探索AI计算要素的物理真实、计算过程的物理本质、计算结果的整体属性,给出AI计算的能力边界及其数学描述。最后,基于对AI计算物理本质的认识基础,洞察出物理AI理论框架,探索其实现途径。
关键词:自由波;秩序;统计属性;信息分类;动态机制;逻辑尺度;
前言
很显然,这是一个复杂、困难的研究课题,不可能用当前行业的主流叙事方式论述。事实上,在没有突破数学的前提下,用文字和图表将我们的理论和思想表达清楚都非常挑战。所以,对我们的观察视角、研究范式、基本概念做一些说明是非常必要的。
主观与客观分离,避免解释鸿沟。如图1,当前研究范式是基于我们在工程实践中形成的认知去适配AI计算的现象,总结规律。本文用客观视角分析AI计算的要素、过程、属性,通过物理法则、数学和逻辑演绎AI计算的底层原理和本质,再解释AI计算的现象和规律。这是脑科学、心理学、复杂系统等领域常用的研究范式。这种范式的经典思想实验有托马斯·内格尔的蝙蝠【1】和弗兰克·杰克逊的黑白玛丽【2】。屏蔽与生俱来的感官直觉与主观认知,选择相信冰冷、自洽的物理和逻辑是非常困难。我们已经习惯以我们感官信息为真实,因为这是我们千万年进化出来的生物本能。这是必须跨越的一步,否则后面的推演无从谈起。
图 1 主观与客观视角分离
体系化研究范式,必须看到一个系统的整体。把工作场景、AI计算单元、服务要求抽象成同等的组件放在一个体系里面研究。如图2,要结构化、层次化研究这个系统的整体:
-
每个组件的客观属性、物理本质;
-
组件之间的连接、系统内部的机制;
-
系统内部的整体逻辑,系统输出功能状态判断与服务要求之间的因果关系;
图 2 体系化研究
注意,系统输出功能的状态判断是一个虚拟组件,是整个体系中逻辑与因果的枢纽。也就是说为了论述方便,在逻辑层面设计的一个组件。
体系化研究的范式在4.1节中有详细举例描述。在智能进化【3】、生命演化【4】等领域的研究课题一般都会放在一个整体生态系统、社会系统研究,因为很显然智能不可能孤立的产生、存在和演进。
宏观与微观分别描述,洞察系统的物理本质。为了论述方便,本文常用宏观时空域代替工作场景,用微观频域描述AI计算单元的内部范畴。宏观时空域和微观频域遵守的物理法则、数学结构都完全不一样,发现宏观时空域和微观频域的整体结构和内在逻辑,并构建一个整体系统,是本文关键的推演目标。
方便阅读,对一些基本概念做出关键含义的说明,以及在本文中的边界限定,不会去复述业界的标准定义。
信息,是非常广泛的概念,但本文限于硅基电路领域,针对电磁波承载信息的方式和本质进行研究。一般在运动、变化中产生信息。
系统是抽象概念,作为一种理论自1948年诞生以来,以路德维希·冯·贝塔朗菲【5】、诺伯特·维纳【6】、德内拉·梅多斯【7】等人为代表,持续研究系统的整体性,内部组件、连接机制、整体功能,强调系统整体结构的稳定性。已经延伸到统计物理、分子生物、信息处理领域,更强调系统复杂性、整体大于部分之和、整体呈现智能涌现等属性。相比本文更愿意用物理和逻辑推演系统的整体结构与属性。
逻辑,描述系统内部(自然界)的结构约束,是系统的本身属性。一般来说,这种结构约束可以用物理法则、数学结构、公理来描述。逻辑推演,输入条件必须是一个物理真实。推演不会产生任何新的事实(信息),只是把系统(前提)蕴含的结构、信息揭示出来。推演只是认知主体的体验,不是逻辑关系本身。
因果关系,是事物之间的一种恒常联结,在确定的时空范围内完全符合我们的经验判断。假如在一个系统内(或者物理的时空范围中)将人的体验、诉求消除,那么该系统内的因果律也将消失。所以,本文研究人员认为因果关系更多存在心理学范畴而非物理学。因果关系完全无法测量,也无法基于物理真实去证明。现实中的因果关系,要么是基于我们利益、体验定义,要么是基于我们的经验分析。因果关系在时间维度一定有先后关系。
整体论证缺少数学和实验数据,缺少数学是我们能力所限,作为独立研究者我们很难有资源验证这样体系化的理论。主要基于物理和逻辑推演,因为我们认为无论硅基智能还是碳基智能的实现原理不可能超越物理和逻辑,局部也会有归纳例证。整体推演尽可能保证逻辑的完整和严密,但是不可避免植入假设和作者的观察,这些都会明确告诉读者。我们也在尽力避免个人立场左右推演与结论,在文中凡是有我们立场倾向的描述都会用“我们认为”方式引入。第六章讨论与展望中的描述,基于我们直觉和立场的成分会更多。
文中大部分举例、示意图以智能驾驶为背景,因为智能驾驶是AI落地的典型场景,在业界被广泛讨论和熟悉。不会影响本文关键结论的普适性、客观性。
01
AI计算理论研究的现状
到目前为止,对AI计算的研究还停留在现象观测、经验总结阶段。
经验和理性告诉我们,一种理论带来产业变革的前置条件,是我们完全掌握了这种理论物理本质和数学结构,没有例外。如果把AI计算作为一种科学研究,其实在我们的理性中已经认定其存在唯一的、客观的原理和本质。其中典范就是,第谷、开普勒、牛顿横跨上百年的时间开展的天体运动规律研究。表格1直观对比天体运动理论和AI计算理论的研究历程,从现象观察、规律总结到理论推演。
表格 1 天体运动理论与AI计算理论研究历程对比
今天看来,给我们的启发是:
-
与第谷、开普勒相比,牛顿一定用了不同的视角和全新的范式;
-
跳出数据记录、运动规律的经验总结,洞察到一个全新物理真实,力;
-
用力、质量、运动这些“风马牛不及”物理量纲构建了一个结构自洽的体系;
所有困难的问题,答案都在另一个层次。本文的基本目标之一,要超越数据层面的规律总结,探索AI计算的物理本质,再解释Scaling law的原因。
02
AI计算的物理本质
AI计算的研究可以分为模型训练阶段和业务推理阶段,这是行业共识。站在我们的视角理解模型训练,就是用一种工程方法把主导场景运转的秩序传递到AI计算单元的参数中,使硅基电路单元产生了秩序。关于秩序的概念在2.3节、4.12节会详细说明。本文不关注AI模型训练过程,只研究AI计算单元在实际推理阶段的微观层面的物理本质和宏观层面的整体属性。如图3,AI计算只涉及三个要素:
-
输入计算单元的信息(数据);
-
计算单元(硅基电路);
-
注入计算单元的权重参数(秩序);
其实注入计算单元除了权重参数还有激活函数,为了简化论述本文只分析权重参数。
图 3 AI计算三要素
说明,为了描述方便,本文将AI推理过程简称AI计算。另外,图3中描述三要素不要和当前业界算力、算法、数据三要素概念混淆。
用主观和客观分离的范式,探究AI计算在物理层面真实、简洁的本质。首先,分析AI计算三要素的物理真实;其次,计算过程三个要素的相互作用和约束,也就是AI计算过程的物理本质和计算结果的整体属性。
假设1,这里已经假设作者掌握的物理、系统理论可以全面准确的解释AI计算的本质,并且不受主观认知的影响,这明显理想化。
2.1 信息的物理真实
在我们看来,人类在利用硅基电路处理信息的路径上,电子电路、计算与通信、AI计算是脉络清晰的三个阶段。按照这三个阶段分析信息的物理真实、存在形式、观察属性,一方面论述方便,另一方面也方便归纳本文关键理论的普适性、客观性。
2.1.1 电平的物理解释
在电路单元里面,电平是最基本的信息表达形式,结合图4分析电平的物理真实、存在形式和观察属性。
图 4 电平的物理真实、存在形式和观察属性
客观视角:是一组客观存在的电磁波,如图4左侧图所示,每一个电磁波都可以用相位、频率、幅值描述其存在的属性。每一个电磁波分布在频域上唯一的频点,如图4中间图所示。
主观视角:所谓电平是我们主观认知物理世界的一种观察值,如图4右侧图所示。在一定程度上可以体现出这组电磁波的组合属性,即在频域上的分布状态。
说明:本文不会具体分析电磁波在频域中的相位、频率、幅值属性,这是具体工程实践中的研究范畴。
每一个独立的电磁波是硅基电路能作用到的最小尺度,也是当前物理学的理论最小尺度。下面介绍的计算与通信单元、AI计算单元处理的信息单元基本组成要素都是电平(一组电磁波)。为了论述方便,又符合本文的思想,后文会把组成电平的一组电磁波统称为自由波。
2.1.2 报文的物理解释
在计算与通信单元里面,报文是基本信息单元。
图 5 报文的物理真实、存在形式与观察属性
客观视角:是一组客观存在的自由波,如图5左侧部分,每一个自由波在时间轴上唯一的分布点,如图5中间部分。
主观视角:所谓报文是我们主观认识物理世界的观察值,如图5右侧部分。0或1对应特定的自由波,报文体现了一组自由波的组合属性,即在时间轴上的分布状态。
2.1.3 Token的物理解释
在AI计算领域Token是基本信息单元,我们日常生活中的图片、视频、文本、语音等符号都可以嵌入到向量/张量里面,可以用不同维度的数组表达。数组仅仅是Token与自由波组合的转换方式,AI计算单元在物理层面处理的只能是自由波。
图 6 Token的物理真实、表达形式和观察属性
客观视角:是一组分布在高维空间自由波,如图6左侧部分。在高维空间的分布属性可以用数组表达,如图6中间部分。
主观视角:所谓文本、图片、视频等符号是我们认识物理世界的观察值,如图6右侧部分。这些符号是我们大脑理解物理世界形成的一致概念,方便我们交流。
2.1.4 信息的定义与意义
信息的物理真实就是一组在不同维度时空域有序分布的若干数量自由波,所谓有序是可以用数学描述其排列组合的结构。需要强调的是,自由波的存在状态是信息的含义,它们动态的排列组合方式更是信息的重要含义。
至于主观视角的观察值,是我们认知物理世界过程中形成的概念,是我们赋予的意义,离开我们的大脑这些观察值没有意义。一般来说,这些观察值与特定的自由波存在一种转换关系,可以用数学描述。比如,可以用傅里叶变换【9】描述电平与电磁波的转换关系;自然语言、图像等符号可以统一嵌入到高维向量空间【10】。这些观察值、数学转换虽然不能体现物理真实的全部,但是能体现一些关键属性,对工程实践是有意义的。
2.2 AI计算单元的物理真实
承载AI计算的物质实体就是一块硅基电路,所谓神经网络是按照计算属性的一种称呼。如表格2,组成复杂神经网络的电路规模尺度与对应的信息尺度。
表格 2 硅基电路规模层级
一个基本共识,晶体管、信道就是复杂神经网络的基本组成要素。对自由波有意义的物理真实是承载在这些基本要素上的电磁场。硅、PCB只是承载电磁场的物质基础,在理论上和工程实践中都合理的一种材料,对自由波、对计算(信息处理)没有直接意义。所以,承载AI计算的复杂硅基电路的物理真实,是大规模有序组合的电磁场。这里的有序包括静态秩序和动态秩序,静态秩序是芯片设计和制造中产生的,动态秩序在2.3节中详细描述。
2.3 权重参数的整体意义
本节的论述确实有作者的直觉成分,当然我们与十几位从业者交流,高度一致的认可。
以交通场景为例解释权重参数的整体意义。一个复杂的交通场景整体上有序运转,至少有如下确定的因素:
-
交通场景的参与者、交通标识、基础设施的存在状态都有规范性;
-
它们在交通场景中的布局、运动都用规律性;
-
它们表达意图、之间的关联关系都有确定性;
以上总称为交通秩序,为了理解方便可以视为交通法规。理想情况下,每一个交通参与者对交通秩序都有一致的理解。
如图7我们认为,模型训练过程就是将交通秩序逐渐传递进权重参数的过程,权重参数的整体意义就是表达了交通场景的运转秩序。当权重参数注入硅基电路中,本质是大规模电磁场产生了动态的秩序。
图 7 权重参数的整体意义
观察说明,权重参数注入产生一种动态秩序,我们推测它会动态影响神经节点、动态调节门电路的输入组合形式和不同输入之间的时序关系。我们的视角,芯片的设计和加工过程本质是建立一种静态秩序。如表格2中,一个基本的晶体管工作时候,本质是把两个电磁场在垂直分布,一个电磁场的工作可以打开或关闭另一个电磁场。这样可以处理有逻辑关系的事件,这就是最基本的电路原理。对于计算和通信的硅基电路,通过协议的方式建立电磁场的秩序,使其可以处理时间序列信息,不是本文的重点不再赘述。
另外,交通场景的运转秩序不仅仅隐藏在交通场景本身运行过程中产生的数据中,也可以隐藏在各种书籍、影像、网络数据中,所以VLA(Vision-Language-Action)等模型常用网络数据进行预训练【11】。关于跨模态的数据收敛于统一的表征,《柏拉图表征假说》【12】研究的非常全面,我们更加坚信认为这个世界的底层有一种统一的秩序。
秩序是本文关键的概念,从复杂系统、分子生命科学领域借用过来的。对比理解,硅基智能是在数学(激活函数、损失函数、奖励函数、梯度下降函数等)结构的主导下产生了秩序,使基本晶体管、信道堆叠出有意义计算单元。碳基智能是在基因的主导下产生了秩序,使基本的细胞组合出有意义的器官。
2.4 AI计算的物理本质
从客观的视角推演AI计算的本质,需要把计算过程和计算结果分开研究。
2.4.1 AI计算过程的物理本质
参与计算的物理真实要素是自由波和电磁场,AI计算过程就是自由波与电磁场相互作用的过程,用如下两个法则描述。
法则一,最短路径。如图8,任何一个自由波的传播路径由边界条件【13】和费马原理【14】【15】(光程最短)决定。通俗的表达,自由波会自动走阻抗匹配的路径无障碍传输,因为这样付出的代价最小。我们更愿意这样表述,自由波有无限的自由度(这就是将一组电磁波定义为自由波的原因),走了所有可能得电磁场通道,最终叠加和抵消后,总体效果只体现在阻抗匹配的电磁场通道上。
法则二,能量守恒,保持稳定。如图8,硅基电路中任何一个神经元(一组门电路)接收到足够的自由波,便会触发激活函数(一组门电路)输出一个值(一组自由波),小到一个基本的晶体管的开关动作也可以这样理解。理想情况下,任何一个基本单元(神经元、门电路)在接收、释放自由波过程中遵守能量守恒,神经元会自动保持稳定。在脑科学研究中也有一致的观点【16】,每一个独立的神经元都要遵守自由能最小法则。
图 8 AI计算的物理过程
当大量的自由波进入大规模的电磁场中,每一个自由波传递遵守法则一,每一个神经元运行遵守法则二。在物理层面分析,微观频域内再没有其他任何因素能作用它们,或约束它们。
以上论述最基本的物理思想就是最小作用量原理,自由波在电磁场中的物理过程一定沿着使"作用量"取极值(通常为最小值)的路径演化。该理论在不同领域的研究非常成熟,经典研究有哈密顿将力学问题转化为几何光学类比【17】、费曼的路径积分【18】、诺特的对称性与守恒律【19】的严格对应。
2.4.2 计算结果的整体属性
复杂建立在简洁之上。在微观频域层面,每一个个体都独立的遵守法则一和法则二。如图9,交通场景产生的大量自由波,在高维空间有静态和动态的排列组合;由于权重参数的注入,大规模电磁场也有静态和动态的秩序。在整体上是一个典型的复杂系统,其计算结果在整体遵守一种统计属性,就是说计算结果有一种统计分布的确定性。
2.4节的解释力较弱。在没有数学突破的前提下,我们目前很难用绝对的逻辑演绎该论断,也很难用语言深刻的描述。2.4.1中电磁场的概念由于篇幅关系无法具体描述,在静态没有信息传输时候其实是一个电场,有变化的信息传输时候才是一个电磁场。原计划引入电磁力来解释发现太复杂,经过反复斟酌当前的解释是准确合理的。2.4.2有复杂系统理论和物理理论基础的读者更容易接受该论断。关于复杂系统遵守统计属性的理论和思想,在业界非常广泛和成熟。典型的研究有约翰·格里宾认为复杂现象本质上源于简单规则的迭代与互动【20】、弗兰克·维尔切克认为复杂性从极简规则中诞生【21】、默里·盖尔曼提出的复杂适应系统【22】等。
我们的直觉,一个模型越接近完美,处理自由波的有效电磁场越少、自由波走的路径越短、整体消耗的能量也越少。
2.5 总结
AI计算本质的解释基础一定是物理学,因为其过程本质是自由波和电磁场相互作用。数学只能描述自由波排列组合方式,以及电磁场的静态秩序和动态秩序,为我们主观理解搭建桥梁。
用图9表达清楚AI计算在客观视角的本质,与主观视角认知理解的关联。
客观视角。AI计算过程只遵守如2.4节中描述的物理法则,计算结果整体遵守一种统计属性。
图 9 AI计算的客观真实与主观理解的关系
主观视角。我们大脑基于观察值(图像、视频)和宏观时空域运转秩序(因果、逻辑等关系)形成一种主观理解,同时大脑对AI计算的过程和原理通过功能抽象形成另一种主观理解,两种主观理解一旦达成某种一致性,并且经常得到工程验证的支持,所以我们就用主观理解替代客观真实,这就是普遍的解释鸿沟。Google DeepMind的亚历山大·勒赫纳对这种情况描述为抽象谬误【23】。
AI计算单元输出的结果,只是自由波和电磁场在遵守物理法则下的客观输出(本质也是一组有序排列的自由波)。对于AI计算单元来说,根本没有正确与错误的概念,都是我们赋予的意义。如图10,AI计算结果与我们的主观预期整体上遵守统计属性。由于权重参数的注入,其计算结果往往落在我们的主观期望区域中,就是所谓的“正确”;如果落在主观期望区域外,就是所谓的“错误”。
图 10 AI计算结果的统计属性
03
为什么AI计算性能遵守Scaling Law?
如果AI计算单元的物理本质是一个基于自由波、电磁场的复杂系统,计算结果在整体上遵守幂率分布属性,就可以用和
定理描述整体误差分布。这里主要借鉴了薛定谔的《生命是什么》【24】中思想,宏观的物理规律本质是一个统计模型。余琦蔚等人发现的宏观热力学代价与微观自由度数量【25】之间存在
法则、梅拉妮·米歇尔和巴克在沙堆崩塌规模的统计分布【26】【27】中发现小规模事件的涨落受
约束等,都是这样的思想。我们认为,在复杂系统领域,幂率分布规律具有普适性。
定理:假设AI计算单元的能力确定, N个自由波表征一个宏观物体,AI计算单元识别这个宏观物体的误差就是
。比如识别一辆汽车,其误差率与表征汽车的像素(自由波组合,实际工程中12个以上自由波表征一个像素,这里为了论述简单假定一个自由波表征一个像素)数量的关系表格3。这就是在智能驾驶中选用高像素的相机,计算效果好的原因。
表格 3 像素量与AI计算误差关系
定理:描述AI计算单元的参数规模(严格意义应该用有效电磁场数量描述,但是我们认为权重参数与有效电磁场数量有某种确定性关系,所以为了简化直接用参数量替代电磁场数量)与计算误差的关系。M是AI计算单元的参数量,AI计算结果的误差分布遵守
代表秩序系数,很显然,训练AI模型的数据量越大,数据质量越高,模型越有序,秩序系数x就越小。x是远远小于1的正数。
在N确定的条件下,假设x=0.1,AI计算单元的参数量与计算误差的关系如表格4.
表格 4 参数量与AI计算误差的关系
直观的理解,比如模型参数M=100000000(1亿),则AI平均计算10000(1万)次出0.1次“错误”。
这就是AI计算结果在整体上遵守scaling law规律的原因。其实在控制论领域,W. Ross Ashby必要多样性定律【28】描述的控制系统增加自身的多样性才能应对被控系统的复杂性,我认为背后的本质与AI计算的scaling law规律一致。
和
定理决定了一个残酷事实,提高AI计算准确性付出的工程代价呈指数增长。比如智能驾驶,永远存在corner case,安全问题无法彻底解决。
说明,AI计算的最终误差由和
共同决定,同时我们的直觉应该是非线性的。
04
物理AI实现的探索
物理AI概念由瑞士联邦材料科学与技术实验室Aslan Miriyev等人【29】于2020年提出,其核心思想是实现机体、控制、形态、动作执行与感知的协同进化,而非仅依赖传统数字AI的算法优化。也有业界专家的表述,物理AI的核心是算法有理解质量、能量、运动、力、时空关系等基本物理法则的能力,或者嵌入特定的约束,使智能体可以动态的融入某种场景运转中。两种表述背后的基本理念一样,都是当前业界的基本共识。
4.1 体系化研究范式
为了论述具体化,用智能驾驶场景举例。如图11,把交通场景、AI计算单元、服务要求,抽象成三个组件放在一个体系里面研究。分析每个组件的结构、属性、合理的假设,追求整个体系的逻辑自洽和因果成立。
图 11 体系化研究范式
4.1.1 服务的安全要求
服务的要求是以我们体验为出发点,就是期望系统输出的功能可以满足我们的体验要求。无论有人还是智能驾驶,驾驶的目的就是从A到B,穷举过程中的状态也就三种:
-
驾驶安全达成,驾乘人员安全;
-
由于智能体探测到某种异常暂停行驶,驾乘员安全;
-
由于智能体的某种失误导致交通事故,停止行驶并损害驾乘人员生命、财产;
很显然,如果智能驾驶系统提供的服务可以收敛于达成和暂停两种状态,永远不出交通事故或违规,那么这种智能驾驶系统就是合理的。
站在服务体验的视角,所有人们的朴素认知,只要不出交通事故损害生命财产,偶尔的暂停服务是可以接受的(其实这种一致的朴素认知是被物理世界的不确定性塑造出来的)。业界普遍认可的道路车辆功能安全标准ISO 26262,基本思想就是探测到系统错误,可以暂停服务保障人员安全。
假设2,系统对自身输出功能的状态有一种判断,可以与我们的体验要求形成因果关系。
其实当前业界的智能驾驶系统都有必要的人为措施判断AI计算结果的正确性,比如用规则兜底、系统备份等就是判断系统输出的正确性,保障服务安全。我们的目标就是让系统对自己输出的结果有“正确”与“错误”的判断,这是我们推演物理AI方案的逻辑终点。
4.1.2 交通场景的信息分类
信息分类是本课题研究团队基础性的突破。
全局视角看问题。如图13,当前业界分析交通场景,必须识别场景中存在多样性的交通参与者、交通标识、交通设施,以及复杂的环境因素。这些要素和因素又是动态的、随机的、复杂的组合,永远有corner case。我们从全局视角看待交通场景,层次化、结构化分析交通场景的整体运转机理和运转状态。
维度信息的描述。一个复杂的交通场景大部分时间都能有序运转,一定有一种秩序(方便理解可以认为是交通法规)主导着场景的运转,而且每一个交通参与者对这种秩序有一致的理解。其实每一个交通设施、交通标识的布局都由这种秩序主导。智能体可以参与到交通场景里面运转的两个条件:
-
承载这种秩序的信息进入智能体;
-
必须对秩序有整体、准确的理解;
这是借鉴艾伦·麦席森·图灵对智能机器的理解【30】。
图灵的话是:to build intelligence machines,it may be best to provide the machine with the best sense organs that money can buy and to teach it to understand and speak English.
所以,我们认为有一种信息可以表征整个场景的运转机理,并隐藏着主导场景运转的秩序,定义为维度信息。为了避免语言的晦涩,用图12表达场景、秩序、信息、智能体之间的关系。
图 12 场景、信息、智能之间的关系
维度信息至少表征以下维度的场景运转含义:
-
参与者的存在状态和固有属性,比如一辆车的体积、位置、速度等;
-
一段时间的动态属性,可以预测下一段时间的运动轨迹;
-
意图与关联;
图 13 交通场景运转机理
本征信息的描述。将图13中的交通要素实体去掉,呈现出如图14的样子,至少展示了以下状态信息:
-
交通道路的时空拓扑关系;
-
交通标识对道路时空使用条件的定义,包括禁止使用的空间、限制条件使用的空间;
-
所有交通参与者在道路空间的分布占用情况;
-
自车(图14中蓝色方块)路径规划的合理性。
以上描述就是交通场景的本征信息,体现了一个特定时刻下交通场景的整体运转状态,特别是自车的路径规划是否有潜在风险。
本征是数学和物理领域的一个概念【31】,本文用本征信息表征场景运转状态。同一个事物在不同场景,本征信息是不同的。比如一辆车,在交通场景的本征信息就是时空位置占用,在一个销售的情景下本征信息就是这辆车的价格(或者价值),在一个商务交流场景下本征信息就是这辆车的品牌。
关于交通场景中的维度信息和本征信息,在赵国栋等人的《智能驾驶系统实时校验机制的研究》【32】中有详细的论述。我们确实借鉴了不同领域的研究思想,比如哈耶克在心理学研究中认为信息分类是感觉的前提【33】。在物理领域这种研究思想比较普遍,比如弗兰克.维尔切克就明确表述,将世界的描述分为状态和定律两个部分是由帮助的【34】。状态描述了“这是什么”,定律描述了“事物如何改变”。本文延伸为用两种属性的信息表征物理场景的运转机理和运转状态。
图 14 交通场景运转状态
总的来说从整体视角看待交通场景存在两种属性的信息,进一步给出完整的定义。
维度信息,是在一段连续的时间和对应的动态空间范围内表征一个场景的运转机理。场景内的维度信息(要素)呈现动态性、相互关联性、随机性、不确定性。
本征信息,是在一个孤立的时间点和对应的静态空间范围内,表征一个场景运转状态。场景内的本征信息是静态的、孤立的、确定的。
4.1.3 AI计算单元的整体属性
参考图15,通过两方面的分析展示AI计算单元的整体属性:
-
AI计算单元整体上遵守的物理法则;
-
AI计算单元整体上与场景之间的关系;
AI计算单元与交通场景作为一个系统,整体遵守如下物理法法则。由于篇幅关系,这部分只能直接给出结论,但是这些结论都是显而易见的。这些法则描述AI计算单元与交通场景之间的关系,是客观视角推演物理AI产生逻辑的支撑点。
假设3,AI计算单元里面是理想模型,就是训练模型的数据集包含了场景中所有工况的数据,不存在corner case。
对称与守恒:
对于一个理想的AI计算单元,可以把表征交通场景运转机理和状态的信息含义全部“理解”。具体包括:AI计算单元里面埋藏的硅基秩序与主导交通场景运转的交通秩序是一致的;任何一个时刻,交通场景里面的交通要素状态分布与数字世界(逻辑层面理解,AI模型中流动的信息一定有一个与交通场景对称的数字世界)里面的本征信息是一致的。
对称与守恒的思想,在算法里面的向量变换也有体现,所有的向量变换一定有一种结构性的不变;其实损失函数、回归函数等都在追求一种状态或结构的不变性。
时空不重叠:
在宏观时空域,事件的运动、变化在时间和空间维度遵守不重叠法则。由于对称性法则,智能驾驶的AI计算单元规划出来的行车路径也必然遵守该法则。
学术的表述,时间不让事件前后重叠在一起,空间不让物质单元重叠在一起。时空不重叠不仅仅在交通场景起作用,有广泛性。比如在我们交流过程中,两个人讲话都需要有一定的空间范围和时间间隔。
时间差:
在宏观时空域,事件的运动、变化是低速的,比如车辆移动速度最快也就30多米每秒。微观频域,电磁波、场的变化的高速的,可以和光速比较。这样,在微观频域规划行车路径花费时间,在宏观时空域里面车辆实际运行花费的时间存在巨大的差。正是这个时间差,为整体系统设计校验机制、规避交通事故提供了可能性。
对应系统论和控制论里面的延迟概念,即行动和效果之间都有时间延迟,本文尽量用物理学概念解释。
AI计算单元与场景之间的关系
对于一个宏观时空域的运转,由相应的宏观秩序主导。如图15,交通场景中的一辆车有其确定的状态属性,车辆体积、颜色、形状等。车辆在运动的时候,每一个时刻都有其确定的空间占用;一小段时间的运动轨迹受力学规律主导;长时间的运动轨迹,与道路时空拓扑关系有关、与交通标识定义一个特定交通场景范围内的行车条件有关、还有交通法规、道路设施条件、个人意愿等都有关;
图 15 AI场景与计算单元之间的关系
客观视角。这辆车的状态属性、运动轨迹、关联因素,以及背后的规律都是这个场景的中的客观存在,场景基于一种客观秩序运转。AI单元里面的计算遵守2.4节描述的物理法则和统计属性。它们之间由一种自由波(太阳光)连接,场景的运转机理影藏在自由波的排列组合中。仅仅是因为权重参数的注入产生了硅基秩序,使AI计算结果有统计分布的确定性。它们之间也没有直接的逻辑或因果关系,交通场景的运动规律也不会直接映射到AI计算单元里面。
当前业界所谓的AI计算已经有因果或逻辑,都是将AI计算结果与我们的主观预期放在一起比较、适配,或者所谓的推理过程符合我们的经验。分析两个行业实例。
实例一:24年发布的OpenAI o1【35】在数学公式计算的应用上,除了给出正确的计算结果还有完整的推理步骤,所以不少从业者认为o1已经有理解事物的因果和逻辑的能力。仔细研究该模型所谓推理步骤,其实是将解题涉及到的信息进行蒙特卡洛搜索,再将这些信息用马尔科夫链排列,而这样的信息排列往往符合我们主观预期的解题步骤。蒙特卡洛搜索就是面对复杂的、不确定的系统,通过概率统计方式逼近问题的本质;马尔科夫链基于转移概率规则描述随机动态系统随时间的变化行为,其背后都是概率思想。
实例二:当前智能驾驶领域的VLA(Vision-Language-Action Model)模型,对于特定的决策可以给出具体原因。比如行驶过程中一次刹车动作,随后可以刹车的原因是前面有锥桶,这符合我们的主观预期,因此不少行业人士认为模型内部计算已经有因果关系。客观的原因是训练阶段,将常规交通标识、参与者、交通设施的数据和执行动作数据关联起来标注,所以模型【36】不仅学习到了交通要素还学习到了关联关系。这种标注成本非常高,需要有经验、高学历的工程师参与数据标注工作。
4.2 物理AI的实现方案
如图15所示,交通场景和AI计算单元之间虽然没有逻辑和因果,但是把它们看成一个整体,并假设是理想系统,将遵守物理法则:对称与守恒、时空不重叠、时间差。再加上前面所分析的两种属性的信息,我们认为物理AI原理和实现途径如图16。
图 16 物理AI原理框架
把物理场景和AI计算单元分别作为一个组件,组成一个系统。对于输出的功能,系统自己有“正确”与“错误”的判断,即系统对自己的输出功能实现逻辑判断。这种功能的状态判断与我们所需的服务要求形成的对应关系就是因果关系。
4.2.1 如何实现逻辑判断?
整体视角看待物理场景,两种属性的信息同时传递到计算单元里面。维度信息传递给AI模型推理出决策结论,遵守统计属性。本征信息传递进来与决策信息做比较,如果达到某种一致性或某种协调性,便认为是“正确”就执行决策,否则调整推理重新给出决策。比如智能驾驶系统规划出来的行车路径(时空范围)里面没有其他参与者的本征信息,设置的行车条件也与实际道路要求的条件不冲突,那么这个决策就是“正确”的。背后的物理法则就是对称与守恒、时空不重叠。
两点说明:
1、利用4.1节中描述的三条物理法则(时空不重叠、守恒与对称、时间差)可以用符号实现逻辑推演。考虑到最关键的秩序概念没有实现数学表达,局部数学论证没意义。
2、由于本征信息属性,在工程实现中可以通过物理方式和先验的方式传递和采集,通过逻辑的方式计算处理。
另一种描述方式,场景和计算单元之间增加了一个实时的校验机制,用一种动态的机制判断决策的合理性。与图9所示的孤立统计单元相比,变为一个完整的逻辑系统。
系统自己逻辑判断成立,因为:
-
一方面本征信息是场景中的物理真实,另一方面依赖的推演规则包括对称与守恒、时空不重叠,显而易见的正确;
-
判断结构简单,就是两种信息的比较;
-
时空不重叠是宏观物理世界的本身的结构属性,计算单元通过处理信息的方式揭示了这种结构属性。
4.2.2 如何实现因果关系?
继续用智能驾驶举例说明,如图17自车的决策(规划未来8s的行车路径)与交通场景中其他参与者、交通设施、时空拓扑关系的本征信息分布情况。
图 17 行车路径规划示意图
说明,由于是用本征信息与规划的行车路径对比,图17中的A车标识其实是A车时空位置占用信息。
如表格5,我们主观视角上对服务的要求,与客观视角上自车规划行车路径和交通场景本征信息分布状态有一对一的映射关系。这种映射关系就是客观和主观之间的因果关系。
表格 5 主观与客观的映射关系
当系统发现空间B有通过本征信息携带进来他车的位置(我们主观的风险)时候,系统自动采取措施规避辆车时空重叠(我们主观的事故)即可。
由于宏观实现和微观计算之间的时间差,保证了因果顺序永远合理。在交通场景中,我们主观的服务要求与客观的本征信息分布是一种恒常联结。比如,交通参与者的位置重叠(本征信中坐标重叠)就是交通事故。
4.3 归纳例证
用文字和图表进行的逻辑演绎,很难体现出这种思想和方案的普适性。举几个例子,供读者进一步理解与思考。
4.3.1 搬运物体的信息处理原理
如图18所示,我们搬运物体这种场景的本征信息就是重量。物体的形状尺寸、材质、位置等信息在一定程度上可以体现重量。这种场景运转的本征要求就是搬运的力与物体的重力一致。信息传递过程和处理原理可以描述如下:
图 18搬运重物的信息处理流程与原理
-
视觉观察物体的尺寸、形态、材质、位置等信息,经过一系列的传递转换,在高级视觉皮层形成综合编码;
-
综合编码与前额叶、海马体存储的经验知识关联,形成决策(重量预估);
-
基于决策形成搬运动作(决策1KG和50KG重物,搬运动作完全不一样),输出搬运力;
-
另一种重量信息,通过手臂肌肉拉伸变化,肌梭被牵拉产生传入信号,信号沿脊髓、丘脑传递并变换,在体感皮层形成重量编码;
-
重量编码与决策(重量预估)对比调整决策,最终输出与物体重力一致的搬力;如果实际重量远超搬运者的体力,会终止搬运动作。信息对比都在基底神经节进行。
-
对比两种信息,也会优化海马体和前额叶内部的经验知识;
注意:基于视觉的决策会因人而异,手臂传递进来的重量信息是物理真实,一致的。
4.3.2 人类驾驶处理信息的原理
如图19所示的人类驾驶,驾驶场景运转的本征要求,大脑中规划的行车路径(做的决策)与场景中所有要素在时空布局上呈现出协调性、一致性。我们在驾驶过程中,信息传递和处理原理可以描述如下:
-
通过视觉感知场景的维度信息,基于我们对交通场景运转秩序的理解,给出行车路径(决策);
-
另一种本征信息的处理:我们开车过程中经常看到、或听到一些突发的、危险的状况,我们总能在“大脑一片空白”的情况下采取合理的应急措施(紧急刹停、转弯等)规避交通事故。
-
你并没有感知到时什么障碍物,仅仅识别到它的位置与规划的行车路径有冲突;
-
这种信息并没有走完整的视觉(或听觉)路径,而是直接传到顶叶皮层处理(海马体也可能参与);
-
处理该信息并没有关联经验知识(交通秩序),而是靠直觉(时空不重叠)快速处理;
-
参与处理该过程的组织很少,应该是顶叶,海马体也可能参与;
-
以上描述的交通场景本征信息,与规划出来的路径(行车策略)做对比,如果达成某种一致性继续执行行车策略,如果有冲突则调整行车策略;
图 19 人类驾驶处理信息流程与原理
4.3.3 硅基系统结构的一致性
在本文第二章节中,我们按照电平、报文、Token三种形态单元描述信息的物理本质、分布属性,对应着三种硅基计算系统,电子系统、计算与通信系统和AI计算系统。本节对比总结三种系统在信息处理上的异同,如表格4,为方便描述,用智能驾驶系统替代AI计算系统。
表格 6 不同硅基系统的异同
由于篇幅关系直接给出归纳性观点。客观视角,硅基系统的革新在于:
-
处理的信息量增大,即自由波的规模增加;
-
让硅基电路产生秩序的方式在变化;
-
校验手段也在相应变化;
革新中不变的东西在于:
-
本质上处理的都是自由波,差别仅仅在分布规模;
-
信息处理过程的物理本质和处理结果的整体属性都可以用2.4节的物理法则和统计属性描述;
-
校验机制的原理都是比较系统两侧的本征信息一致性或协调性;
总的来说,电子、计算与通信、智能驾驶系统必须有实时校验机制,整体成为一个逻辑系统,系统自己有“正确”与“错误”判断,而且可以用同一套框架描述系统的校验原理。差别仅仅是逻辑的尺度不同,电子系统的逻辑针对一个电平信息,即一个自由波(频域上分布的一组电磁波);计算与通信系统的逻辑针对一个报文信息,即一组分布在时域上的自由波;智能驾驶系统的逻辑针对时空域的视频信息,即分布在高维空间的大量自由波。
4.3.4 一种有意思的观察
F=ma;E=mc²;iħ·∂ψ/∂t=Ĥψ等物理公式,等号两侧都是不同属性的物理量纲。
我们的归纳性总结:
-
把不同属性的物理量纲放在一个体系研究,对比达成某种一致性,是表达物理规律的基本范式;
-
把不同属性的信息放在一个体系里面处理,对比达成某种一致性,应该是智能体“理解”物理世界结构的基本范式,也就是物理AI实现的基本途径。
在真实的物理场景中,智能体采集不止一种本征信息,比如在搬运图18中的物体,除了判断物体的重量,还有物体的表面温度,以及搬运过程中场景里面时空位置。我们认为智能体理解物理世界的通用范式,通过处理视觉为主的信息与经验性知识给出综合的决策,再通过触觉、体感、听觉等传递不同的本征信息,实现对复杂场景的理解并参与到其中的运转中。多种本征信息处理的原理图,可以扩展图16来表达,不再赘述。
其实,业界对认知、思维产生的研究涉及到不少类似的思想。心理学家蒂娜·斯科尼克·韦斯伯格【37】提出的what-if机制中的实现校准,就是基于客观物理场景中的某种信息做比较。R.S. Green在1980年就提出Interactive scaling【38】已经有多种信息交互的理念。但是我们认为,交互只是表象,关键要有信息分类、对比的思想,以及逻辑自洽的系统。
05
结论
本文以物理和逻辑为关键支点,推演出AI计算过程的物理本质就是2.4节描述的两个法则,计算结果在整体上遵守统计属性。同时推演出了一套与模型无关的物理AI系统框架,模型仅仅是处理信息的方式,系统内部的一个组件。
核心思想,系统对自己输出的功能实现逻辑判断,与我们的服务需求形成因果关系。
信息分类与信息环路是系统自己产生“正确”与“错误”判断必要的、基础的条件。
看问题的视角和研究问题的范式也是本文的重要贡献。
06
讨论与展望
本章增加一些讨论和观点,展示出我们的研究全貌和背后的哲学思考。也确实有我们的立场,但是没有直接影响前面5章的论述。
另外,这样的研究课题涉及的领域非常广,再加上我们的能力、研究资源和时间所限,整体推演的完整性和严密性并不理想。
6.1 数学的缺失
整体推演缺少基本的数学符号和公式是本文的局限。仅用文字和图表描述,很难将思想、结构表达清晰和完整,数学突破是我们未来一项艰难而有意义的工作。表格7,给出数学曾经在信息处理领域奠基性应用,以及在AI计算领域用数学描述秩序的重要意义。
表格 7 数学在信息处理发展历程的应用
业界也有不少专家基于统计物理解释AI计算本质,试图用熵连接微观和宏观。这可能因为将熵引入信息领域研究信息的不确定性、测度曾经取得过巨大成就。但是在我们看来,熵在AI计算领域还很难有所作为。无论克劳修斯的热力学【40】理论提出的熵,还是玻尔兹曼的统计物理学【41】中提出的熵,虽然用熵将微观和宏观关联起来,但是只描述了微观和宏观的一部分属性,即存在状态。无法表达宏观时空域的动态属性,包括时间序列属性、相互关联与意图、或者更高维度的信息含义。这部分属性在通信领域完全靠人脑处理,硅基系统不涉及,但是在AI计算领域硅基系统必须处理这部分属性。其实香农自己也明确地声明,信息论研究信息的统计特性,不是信息的含义。
所以本文没有用熵这个概念,而是用秩序来连接宏观和微观,不仅可描述宏观与微观整体的动态属性,同时也较好的解释了模型训练的意义。
秩序的数学表达一定会超越概率的范畴,应该涉及信息几何、李群和李代数。
6.2 关于“不可解释性”的解释
当前业界对AI的工作原理颇为神秘,再加上涌现、泛化性等现象,甚至有一种担忧。所谓的“不可解释性”是指AI计算在解析信息过程中出现“错误”或“正确”的结果,无法用我们认知中的一些逻辑、流程、因果方式找到具体的原因。这是典型的主观和客观混淆,造成的解释鸿沟。
客观的视角。AI计算单元就是大规模有序的电磁场,输入其中的信息就是分布的高位空间的自由波,所谓的计算过程就是遵守4.2节描述的两个法则的过程。解释的尺度必须是整体系统,去理解任何一个局部、或一段过程是没有意义的。比如权重参数,在自由波和电磁场适配的过程中,每一个参数或多或少、或直接或间接都会产生影响,但是任何一个参数都起不到主导作用。
所以,我们认为“不可解释性”就是AI模型的基本属性(统计属性),模型里面根本就没有逻辑与因果。逻辑的判断必须针对整体系统。当前AI计算领域不少人希望搞清楚AI计算单元内部的逻辑、计算步骤,寻求AI计算的可解释性,是理念上的错误。
至于涌现、泛化是解释力很弱,甚至有消极倾向的表述。任何AI计算出来的结果(或呈现的现象)一定有其对应的物理过程,但是它超越了我们的认知范畴。我们不能理所当然地认为,我们理解的世界就是客观真实物理世界。一个客观事实,我们只能理解物理世界里面一部分规律、秩序、结构。因为在相当长的时间里面,我们的智力进化的方向是为自己生存服务,够用就好。
随着AI技术的发展,如图20很明显形成三个不一致的世界,客观真实的物理世界、我们(碳基智能)的认知世界、AI(硅基智能)的认知世界。当硅基世界超越我们的认知范围,尤其在高维空间的秩序,就产生了所谓的涌现、泛化等。
图 20 物理、碳基、硅基三个世界
人类在漫长进化中,尤其现代文明的发展中产生了大量的文字、图片、视频等符号,这些符号隐藏了我们日常生产、生活中的秩序。由于这些数据获取便利,大语言模型快速地将隐藏的秩序传递到硅基世界中。所以,当前硅基世界和碳基世界的范围大部分是重叠的。
6.3 碳基智能与硅基智能的实现原理一致
文中不少章节涉及AI计算单元与人类大脑处理信息的对比,并不是简单的经验归纳、观察结果类比,我们认为AI计算实现智能的原理与人类大脑实现智能的原理是一致的。这种观点在业界确实没有统一争议很大,甚至有AI领域顶级科学家在前后几年内表达出不一致的观点。
人脑神经元中传递的化学物质有数百种,硅基单元当然没有复杂的材料,更别说化学物质,我们需要了解这些化学物质承载的信息属性、作用。
我们认为的一致是在微观层面和抽象的系统层面:
-
在微观粒子、相互作用、遵守的物理法则和整体的统计属性都是一致;
-
在抽象的系统层面,基本的信息环路、动态机制、整体逻辑、因果映射、功能实现等原理是一致的;
我们认为的一致理由:
-
硅基智能和碳基智能活动在统一结构的物理场景,所以出入信息的属性、分类是一样的。两种智能输出的服务要求也是一致的。
-
我们的信仰,自然法则绝对不会支持两种完全不同的智能实现原理,因为这会破坏宏观和微观物理世界整体结构的简洁优美性,也违反整体运行代价最小原则。
在大脑工作原理、智能实现等研究领域,正在形成一个基本的共识。大脑对事物变化的理解判断,内部有一个信息环路,基本范式如图21。以视觉为主的信息进入新皮层,大量的神经元参与信息处理产生一种模式理解;另一种信息进入某种组织,相对只需要少量的神经元参与处理提取出事物的属性;携带模式的信息与携带属性的信息在基底神经节汇合对比,产生了逻辑判断,再与事物变化原理形成一种映射关系。很明显,这和图16描述的物理AI工作原理在框架上是一样的。
图 21 大脑产生逻辑的信息环路
举个例子对比理解,飞机和鸟类的材质、组成形式、飞行方式完全不一样,但是它们一定遵守完全一样的空气动力学,自然法则不会区分鸟类的空气动力学与飞机空气动力学。
其实在AI计算领域一直有人对比研究大脑的工作原理,比如Geoffrey.Hinton提出的反向传播误差机制【42】是受生物学启发的,早期试图在计算机上模拟脑细胞网络学习机制的核心尝试。
6.4 总结与展望
AI计算只有成为一种科学理论,才能提供稳定、一致的服务。
6.4.1 总结
站在我们的视角,当前业界研究AI的范式就是通过设计或改进算法提取物理世界的秩序。从CNN【43】、RNN【44】,到Transformer【45】等AI模型框架的提出与发展,提取物理世界秩序的效率和准确性越来越高。这是必要的,但不是物理AI的全部。
本文突破在于发现了物理世界的结构,所谓物理AI本身就是物理世界的一部分,只有在结构上一致,才能真正的“理解”这个世界,并融入这个世界。智能绝对不可能孤立的产生。
6.4.2 AI计算产业发展展望
AI计算形成规模化产业,需要具备一些基本条件。
首先,AI计算成为一种可解释、可计算、可预测的理论体系,并且这种理论体系在信息处理领域具有普适性。这样才有可能提供大规模确定性、一致性的服务。
其次,自我演进的范式。如图16,当本征信息与决策值比较不一致时候,不仅要采取措施规避事故,同时精确记录场景数据。基于这些异常场景数据训练AI模型一定会低成本、高效率,客观上形成AI模型自我演进的范式。硅基智能必然经历一个在硅基生态系统中自我演进、逐步成长的阶段,在保障安全的前提下服务体验越来越好。当前靠人工采集数据、人工主观调整,不可能走向规模化、产业化。
最后,我们试图给物理AI下一个准确的定义。就是智能体(人、机器人或其他形态)有能力实时理解物理世界的运转秩序,并动态地融入物理世界的运转中。这要求智能体:
-
有能力预判物理场景未来一段时间运转状态;
-
并可以实时校验自己的预判是否正确,实现自己的目的性;
-
这种目的性与我们的服务要求存在因果关系;
信息分类和信息环路是实现以上功能必要的、基础的条件。
如果这样的智能原理实现,整个物理场景分布着独立决策的智能体,智能体自己有目的性,整个物理场景运转呈现弹性状态,永远不会出现损害人类的事故。
6.4.3 智能驾驶展望
我们的观察,交通是AI计算落地最佳场景,没有之一。因为,一交通领域产业价值巨大;二面交通场景的信息维度少,信息结构简单;三服务的要求单一。可以这样观察,交通场景的运转与感情、道德、教育程度、财富、背景等都没有关系,任何一个司机一旦掌握的驾驶技能,基本可以在任何交通场景开车,可以服务任何人。
智能驾驶产业价值绝对不是在一些封闭场景、或者在苛刻条件下解放人类的手脚眼。应该像互联网一样应用简单,走进千家灯火万家炊烟,让每个人都拥有完整的时间和空间。
参考文献(References)
[1] Thomas Nagel, What Is It Like to Be a Bat?,The Philosophical Review, Vol. 83, No. 4,pp.435-450, Oct.1974.
[2] Frank Jackson,What Mary Didn't Know,The Journal of Philosophy,Vol. 83, No. 5,pp.291-295,May.1986.
[3] Max Bennett,A Brief History of Intelligence: Evolution, AI, and the Five Breakthroughs That Made Our Brains,Mariner Books,Houghton Mifflin Harcourt.
[4] Yuval Noah Harari,Sapiens: A Brief History of Humankind,Harper(HarperCollins Publishers imprint),2014.
[5] BERTALANFFY L V,General,System Theory,Foundations,Development,Applications[M].New York, USA,George Braziller,1968.
[6] WIENER N,Cybernetics or control and communication in the animal and the machine[M],Cambridge, Massachusetts, USA, The MIT Press,1948.
[7] MEADOWS D H.Thinking in systems:A Primer [M] Chapter 1.Chelsea Green Publishing, Vermont,2008:20.
[8] Jared Kaplan, et al., Scaling Laws for Neural Language Models,arXiv:2001.08361.
[9] Jean-Baptiste Joseph Fourier,Analytical Theory of Heat,Didot,1822.
[10] Alec Radford, et al.Learning Transferable Visual Models From Natural Language Supervision,International Conference on Machine Learning (ICML) 2021,https://arxiv.org/abs/2103.00020.
[11] Seonghyeon Ye, et al., Latent Action Pretraining from Videos,ICLR 2025,latentactionpretraining.github.io.
[12] Minyoung Huh, et al., The Platonic Representation Hypothesis, arXiv:2405.07987.
[13] James Clerk Maxwell, A Dynamical Theory of the Electromagnetic Field,Philosophical Transactions of the Royal Society of London,Vol. 155,pp459-512,1865,https://www.jstor.org/stable/108892.
[14] Christiaan Huygens,Treatise on Light,Macmillan and Co.,1912.
[15] Pierre Louis Moreau de Maupertuis,Accord de plusieurs lois naturelles qui avaient paru jusqu'ici incompatibles,Histoire de l'Académie Royale des Sciences de Paris,pp418-426,1744.
[16] Karl J. Friston,The free-energy principle:a rough guide to the brain?,Nature Reviews Neuroscience,Vol. 11, No. 2,pp127-138,10.1038/nrn2787.
[17] William Rowan Hamilton,On a General Method in Dynamics,Philosophical Transactions of the Royal Society of London,V.125,pp95-144,1835.
[18] Richard Phillips Feynman,The Principle of Least Action in Quantum Mechanics,DOI: 10.1142/9789812567635_0001.
[19] Emmy Noether,Invariante Variationsprobleme,Nachrichten von der Gesellschaft der Wissenschaften zu Göttingen, Mathematisch-Physikalische Klasse,pp235-257,1918.
[20] John Gribbin, Deep Simplicity: Bring Order to Chaos and Complexity, Random House,2005.
[21] Frank Wilczek, Fundamentals: Ten Keys to Reality, Penguin Books,2022.
[22] Murray Gell-Mann, The Quark and the Jaguar: Adventures in the Simple and the Complex, W.H. Freeman and Company,1994.
[23] Alexander Lerchner,The Abstraction Fallacy:Why AI Can Simulate But Not Instantiate Consciousness,PhilArchive,PhilArchive ID:philarchive.org/rec/LERTAF.
[24] Erwin Schrödinger, What is Life? With Mind and Matter and Autobiographical Sketches, Cambridge University Press,1944.
[25] Weiqi YU, et al.,Inverse Power Law Scaling of Energy Dissipation Rate in Nonequilibrium Reaction Networks,PHYSICAL REVIEW LETTERS (ISSN: 0031-9007),Feb 2021,http://hdl.handle.net/20.500.11897/605141.
[26] Melanie Mitchell,Complexity: A Guided Tour,Oxford University Press,2009.
[27] Per Bak, et al.,Self-organized criticality: An explanation of the 1/f noise,Physical Review Letters (PRL),Vol. 59, No. 4,pp381–384,1987.
[28] W. Ross Ashby,An Introduction to Cybernetics,Chapman & Hall,1956.
[29] Aslan MiriyevSkills for physical artificial intelligence,Nature Machine Intelligence,Vol. 2, No. 11,pp658-660,Nov 2020.
[30] Turing A M. Computing machinery and intelligence [J]. Mind, 1950, 59(236): 433.
[31] FEYNMAN R,LEIGHTON R,SANDS M.The Feynman Lectures on Physics Volume Ⅲ 8-3[M],Massachusetts USA,Addison Wesley.
[32] zhaoguodong, et al.,Research on Real time Verification Mechanism of Intelligent Driving System,Automotive Engineering,2025, 47(7): 1344-1356.
[33] HAYEK F A. The Constitution of Liberty[M]8-6, USA Chicago:University of Chicago Press,1960.
[34] Frank Wilczek,Fundamentals: Ten Keys to Reality,Penguin Press,Jan 2021.
[35] OpenAI,OpenAI o1 System Card,Dec 2024,arXiv:2412.16720v1.
[36] Yulong Cao, et al.,Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail,Oct 2025,arXiv:2511.00088.
[37] Deena Skolnick Weisberg,Pretend Play,Wiley Interdisciplinary Reviews: Cognitive Science,Vol. 6, No. 3,pp176-192.
[38] R.S. Green,Interactive scaling: A demonstration,Bulletin of the Psychonomic Society,Vol. 16, No. 3,pp231-233.
[39] SHANNON C, A Mathematical Theory of Communication[J],Bell System Technical Journal,Oct 1948.
[40] Rudolf Clausius, On the Application of the Theorem of the Equivalence of Transformations to Internal Friction, 125 (1865), pp353–400.
[41] Ludwig Boltzmann, On the Relation between the Second Law of Thermodynamics and Probability Calculus, with Respect to the Laws of Thermal Equilibrium, Entropy, Vol. 17, No.4(2015),pp1971-2009.
[42] Geoffrey E. Hinton,Learning representations by back-propagating errors,Nature,Vol. 323, No.5988,pp533-536,Oct 1986.
[43] Yann LeCun, et al.,Backpropagation Applied to Handwritten Zip Code Recognition,Neural Computation,Vol.1, No. 4,pp541-551,Dec 1989.
[44] Jeffrey L. Elman, Finding Structure in Time, Cognitive Science, Vol.14, No. 2,pp179-211,Mar 1990.
[45] Ashish Vaswani, et al.,Attention Is All You Need, NIPS 2017, Advances in Neural Information Processing Systems 30,pp5998-6008.
联系作者:gd_zhao@163.com
热门文章
更多精华美文扫码阅读
焉知汽车
焉知机器人

请先 登录 后再发表评论~