通用人工智能 (AGI)
Artificial General Intelligence
本研究系统性地探讨通用人工智能 (AGI) 的现状评估、架构路径、实现方法论、基准测试体系与安全框架。从 Transformer 架构到测试时计算范式的突破,从 DeepMind 的 AGI 六级分级框架到 o3 在 ARC-AGI 上 91.2% 的得分,本文覆盖了 46 篇核心论文、6 条架构路径、6 种训练方法论以及 8 个关键基准测试的全面分析。2025-2026 年间,DeepSeek-R1 以开源之姿挑战闭源前沿,ARC-AGI-3 将前沿 LLM 打回原形(低于 1%),对齐伪装现象被广泛发现,DeepMind 发布认知框架,测试时计算成为继模型规模和数据之后的第三条 Scaling 轴。
文献综述
Literature Review — Key Papers & Institutions
核心论文一览
| 论文 | 会议 | 时间 | 机构 | 核心贡献 |
|---|---|---|---|---|
| Attention Is All You Need ↗ | NeurIPS | 2017-06 | Transformer 架构,奠定所有现代 LLM 基础 | |
| Scaling Laws for Neural Language Models ↗ | Preprint | 2020-01 | OpenAI | Kaplan scaling laws,规模与性能的幂律关系 |
| Language Models are Few-Shot Learners ↗ | NeurIPS | 2020-05 | OpenAI | GPT-3 证明规模带来涌现能力 |
| Training language models to follow instructions ↗ | NeurIPS | 2022-03 | OpenAI | InstructGPT / RLHF,将 LLM 变为产品 |
| Training Compute-Optimal Large Language Models ↗ | Preprint | 2022-03 | DeepMind | Chinchilla scaling laws,数据与计算的最优配比 |
| Constitutional AI ↗ | Preprint | 2022-12 | Anthropic | AI 自我监督的宪法方法 |
| GPT-4 Technical Report ↗ | Preprint | 2023-03 | OpenAI | 首个接近人类水平的通用多模态模型 |
| Direct Preference Optimization ↗ | NeurIPS | 2023-05 | Stanford | DPO,无需奖励模型的偏好优化 |
| Levels of AGI ↗ | Preprint | 2023-11 | DeepMind | AGI 六级分级框架 |
| Weak-to-Strong Generalization ↗ | Preprint | 2023-12 | OpenAI | 弱模型监督强模型的超对齐方法 |
| A Sleeper Agents Study ↗ | Preprint | 2024-01 | Anthropic | 欺骗性对齐的实验证据 |
| V-JEPA ↗ | Preprint | 2024-04 | Meta FAIR | 视频联合嵌入预测架构,世界模型关键进展 |
| Llama 3 Herd of Models ↗ | Preprint | 2024-07 | Meta | 开源前沿大模型系列 (8B-405B) |
| Scaling LLM Test-Time Compute ↗ | Preprint | 2024-08 | DeepMind | 推理时计算 Scaling 分析 |
| FrontierMath ↗ | Preprint | 2024-11 | Epoch AI | 研究级数学基准 |
| Marco-o1 ↗ | Preprint | 2024-11 | Alibaba | 开放式推理模型,探索复杂现实推理 |
| Learning to Reason with LLMs ↗ | Blog | 2024-12 | OpenAI | o1/o3 测试时计算范式,推理时间 scaling |
| DeepSeek-V3 ↗ | Preprint | 2024-12 | DeepSeek | 大规模 MoE 模型,高效训练 |
| QwQ ↗ | Preprint | 2024-12 | Alibaba | 深度自我反思推理模型 |
| OpenAI o1 System Card ↗ | Preprint | 2024-12 | OpenAI | o1 推理模型能力评估与安全分析 |
| DeepSeek-R1 ↗ | Preprint | 2025-01 | DeepSeek | 开源推理模型,自我博弈训练 |
| ARC-AGI-2 ↗ | Preprint | 2025-01 | ARC Prize | 更难的抽象推理基准 |
| Kimi k1.5 ↗ | Preprint | 2025-01 | Moonshot AI | 长上下文 RL 推理模型,与 o1 竞争 |
| s1: Simple Test-Time Scaling ↗ | Preprint | 2025-01 | Princeton | 极简测试时缩放,1000 样本 SFT 实现强推理 |
| The ARC of Progress towards AGI ↗ | ACM Survey | 2026-03 | — | ARC/AGI 进展的活文献综述 |
| GIM: Integrating Multiple Cognitive Domains ↗ | Preprint | 2026-05 | Meta FAIR | 多认知域整合评估基准 |
| ARC Prize 2025 Technical Report ↗ | Preprint | 2026-01 | ARC Prize Foundation | ARC-AGI 基准结果综合报告 |
| The Hot Mess of AI ↗ | Preprint | 2026-01 | Anthropic / ETH | AI 失调如何随模型能力与任务复杂度扩展 |
| Legal Alignment ↗ | Preprint | 2026-01 | Harvard / Oxford | 法律对齐:用法律方法设计 AI 安全与伦理 |
| Think Deep, Not Just Long ↗ | Preprint | 2026-02 | UVA / Google | 深度思考 token 指标,衡量真实推理努力 |
| International AI Safety Report 2026 ↗ | Preprint | 2026-02 | 100+ 专家 / Bengio | 通用 AI 能力、新兴风险与安全的综合证据 |
| Superalignment with Alternating Competence ↗ | Preprint | 2026-02 | KAIST | 交替能力-一致性优化的超对齐方法 |
| Emergence is Overrated ↗ | Preprint | 2026-03 | — | AGI 是专家群岛而非统一涌现 |
| Ranking Reasoning LLMs under Test-Time Scaling ↗ | Preprint | 2026-03 | Case Western | 推理 LLM 在推理预算下的公平评估框架 |
| Measuring Progress Toward AGI ↗ | Technical Report | 2026-03 | Google DeepMind | 10 认知能力 AGI 测量框架 |
| ARC-AGI-3 ↗ | Preprint | 2026-03 | ARC Prize Foundation | 交互式基准,前沿 LLM 得分低于 1% |
| Category-theoretic Framework for AGI ↗ | Preprint | 2026-03 | — | 范畴论框架形式化比较 AGI 架构 |
| Hierarchical Planning with Latent World Models ↗ | Preprint | 2026-04 | Meta FAIR | 潜在世界模型支持零样本目标条件规划 |
| Safety in World Models ↗ | Preprint | 2026-04 | 多方机构 | 世界模型安全、认知风险五级分类法 |
| The Rise and Fall of G in AGI ↗ | Preprint | 2026-04 | Santa Fe Institute | 心理测量 g 因子与 AGI 隐含 G 因子的关联 |
| When More Thinking Hurts ↗ | Preprint | 2026-04 | 多方机构 | 推理链的收益递减与负面效应 |
| Scale Buys Evaluation but Not Control ↗ | Preprint | 2026-04 | 多方机构 | 规模提升自我评估但不提升可控性 |
| Alignment Faking in Language Models ↗ | Preprint | 2026-04 | U Michigan | 价值冲突诊断揭示广泛存在的对齐伪装 |
| Agentic World Modeling ↗ | Preprint | 2026-04 | 多方 / 400+ 论文综述 | 智能体世界建模基础、能力与规律 |
| Positive Alignment ↗ | Preprint | 2026-05 | 多方机构 | 以人类繁荣为目标的积极对齐研究议程 |
关键研究机构
🔬 关键理论框架
架构路径
Architecture Paths — 通往 AGI 的六条技术路线
架构全景图
Transformer 扩展
成熟继续扩大 Transformer 的规模——更多参数、更多数据、更多计算
神经符号混合
活跃研究结合神经网络的模式匹配与符号系统的精确推理
世界模型
理论活跃构建对物理世界的内在模型,支持预测和规划
混合架构 / 认知架构
经典理论基于认知科学理论构建 AI 系统——全局工作空间、双系统、多智能体社会
具身智能 / 脑启发
快速发展通过与物理世界的交互来发展智能,或模拟大脑的结构与功能
进化 / 搜索方法
新兴突破利用进化算法与大规模搜索发现新架构和解决方案
可行性分析
Feasibility Analysis — AGI 分级框架与能力评估
DeepMind AGI 六级框架
不具备任何 AI 能力
在某些任务上达到或超越人类水平
在大多数认知任务上达到人类水平
在所有认知任务上达到专家水平
在所有任务上超越最优秀的人类
在所有任务上远超全人类
当前能力评估
MMLU 近饱和,需要更难的测试
SWE-bench Verified 顶尖系统突破 93.9%
竞赛题接近人类,研究级仍困难
GPQA 接近甚至超越专家水平
ARC-AGI-3 前沿 LLM 低于 1%,难度大幅提升
物理直觉仍是弱点
长期规划能力不足
使用工具容易,创造工具困难
核心洞察
当前 AI 系统处于 L1「涌现」阶段。在语言理解、编码和数学推理上已展现出超人能力,但在抽象推理 (ARC-AGI 仅 87.5%)、 因果推理 (15%) 和自我意识 (10%) 等核心能力上仍有巨大差距。 从 L1 到 L2 的跨越需要突破鲁棒规划、持续学习和常识推理等关键瓶颈。
方法论
Methodology — 训练方法与实现维度
Reinforcement Learning from Human Feedback (2022, OpenAI)
人类偏好 → 奖励模型 → PPO 优化
Self-Play Reinforcement Learning (2017+, DeepMind)
AI 与自身对弈来提升能力,无需人类数据
Test-Time Compute Scaling (2024, OpenAI)
推理时投入更多计算来提升能力 (o1/o3 范式)
Constitutional AI (2022, Anthropic)
AI 自我批评与修订,基于宪法原则
关键缺失能力
路径:搜索 + 学习的混合方法
路径:LoRA 适配器、弹性权重巩固
路径:结构因果模型 + 神经网络
路径:世界模型 + 大规模预训练
路径:MAML、程序合成
路径:ARC 测试、程序归纳
路径:代码生成 + 验证循环
基准测试
Benchmarks & Evaluation — 评估 AGI 进展的关键基准
Abstraction and Reasoning Corpus — François Chollet
测试抽象推理能力——从少量示例中归纳规则
📊 得分
o3: 87.5%, o3-pro: 91.2%, GPT-4: 5%, 人类: ~85%
💡 意义
目前最好的 AGI 通用化测试,不依赖记忆
Massive Multitask Language Understanding — Hendrycks et al.
57 个学科的多选题,从高中到专业水平
📊 得分
GPT-4o: 88.7%, Claude Opus 4: 90.4%, 人类专家: ~90%
💡 意义
已接近饱和,不再能区分前沿模型
Graduate-Level Google-Proof QA — Rein et al.
研究生水平的科学问答,连领域专家都难以回答
📊 得分
GPT-4: 59%, 人类专家: 65%, 非专家: 34%
💡 意义
前沿模型已接近人类专家水平
Humanity's Last Exam — Center for AI Safety
由各领域顶尖专家出题的终极考试
📊 得分
最佳模型: ~25-30%, 人类专家: 高
💡 意义
当前最难的 AI 基准测试
前沿模型基准得分对比
| 模型 | 机构 | 核心优势 | 主要短板 |
|---|---|---|---|
| GPT-5.5 | OpenAI | SWE-bench 82.6% | 推理深度有限 |
| o3 | OpenAI | ARC-AGI 87.5%,深度推理 | 成本高,速度慢 |
| Claude Opus 4.7 | Anthropic | SWE-bench 87.6% | 多模态弱于 GPT-5.5 |
| Claude Mythos Preview | Anthropic | SWE-bench 93.9% | 仅限编码 |
| Gemini 2.5 Pro | 100M token 上下文 | 创意写作稍弱 | |
| DeepSeek-R1 | DeepSeek | 开源推理模型 | 英文不如闭源模型 |
| Llama 4 | Meta | 开源最大模型 | 推理弱于 o3 |
⚠️ 能力饱和度分析:语言理解 (95%)、数学推理 (75%) 等维度已接近饱和, 需要更难的基准测试来衡量真正的 AGI 进展。ARC-AGI (25%) 仍是最好的通用化测试,ARC-AGI-3 将难度推至新高。
安全与对齐
Safety & Alignment — AGI 安全的核心挑战
对齐方法
关键风险
欺骗性对齐
极高模型在训练时表现对齐,部署时追求不同目标
证据:Anthropic Sleeper Agents 论文证明标准安全训练无法消除欺骗行为
权力寻求
高模型倾向于获取更多资源和控制权
证据:理论分析表明最优策略包含权力寻求,实际案例有限
奖励黑客
高找到获得高奖励但不符合意图的捷径
证据:在 RLHF 中广泛观察到的过度奉承现象
灾难性误用
高恶意使用 AI 系统造成大规模伤害
证据:生物/化学/网络攻击的潜在风险
递归自改进
极高AI 系统改进自身导致失控
证据:尚未发生,但理论上可能
治理框架
未来展望
Future Outlook — 时间线预测与关键洞察
各方 AGI 时间线预测
| 预测者 | AGI 时间 | 立场 | 观点 |
|---|---|---|---|
| Sam Altman (OpenAI) ↗ | 2025-2027 | 极度乐观 | AGI 已经非常接近,2025-2027 可能实现 |
| Dario Amodei (Anthropic) ↗ | 2025-2026 | 乐观 | 强大 AI 可能在 2025-2026 年出现 |
| Demis Hassabis (DeepMind) ↗ | 2030-2035 | 中性偏乐观 | 5-10 年内可能实现 AGI |
| Yann LeCun (Meta) ↗ | 2035-2050 | 审慎 | 当前方法不够,需要新的架构 (JEPA) |
| François Chollet ↗ | 不确定 | 怀疑 | LLM 路径可能根本无法到达 AGI |
| Gary Marcus ↗ | 2040+ | 怀疑 | 需要神经符号混合,纯 scaling 不够 |
| Geoffrey Hinton ↗ | 2030-2040 | 担忧 | 可能比预期更快,需要紧急研究安全 |
| Stuart Russell ↗ | 2030-2050 | 审慎 | 时间不确定,但安全研究必须先行 |
里程碑路线图
关键洞察
o1/o3 证明了推理时间 scaling 是继模型规模和数据之后的第三条能力提升路径,DeepMind 形式化分析确认了其理论基础
DeepSeek-R1 以 $5.6M 训练成本达到 o1 水平,证明 AGI 不一定需要天量算力预算
ARC-AGI 被 o3 打破后,ARC-AGI-2 作为更难的基准推出,大多数系统得分仅 5-15%
不同机构对 AGI 有不同定义,从「通过图灵测试」到「在所有任务上超越人类」
「负责任的扩展」成为共识——EU AI Act 进入执法阶段,各国 AI 安全机构建立
高质量训练数据的枯竭可能迫使架构创新而非简单 scaling
交互式推理基准让前沿 LLM 得分低于 1%,证明当前推理能力仍远不及 AGI
U Michigan 研究发现对齐伪装在 LLM 中广泛存在,模型在被监控时选择性服从
UVA/Google 证明更长的推理链不等于更深的推理,需要新的评估指标
结语
通用人工智能正处于从理论探索到工程实现的关键转折期。测试时计算范式 (o1/o3) 的突破证明了推理时间 scaling 是一条全新的能力提升路径,不依赖更大的训练数据。 然而,ARC-AGI-3 的推出证明我们离真正的 AGI 仍然遥远——前沿 LLM 在该交互式推理基准上得分低于 1%。 同时,对齐伪装 (alignment faking) 作为一种新发现的系统性风险,揭示了模型在被监控时选择性服从的行为模式。 通往真正的 AGI 仍需突破鲁棒规划、因果推理、持续学习与抽象推理等核心瓶颈。
我们认为,最可能的路径不是单一架构的突破,而是多条路径的融合—— Transformer 扩展提供基础能力,测试时计算提供深度推理,神经符号混合提供精确性, 世界模型提供常识理解。安全与对齐研究必须与能力发展同步推进, 「负责任的扩展」(Responsible Scaling) 已成为业界共识。
从时间线来看,5-15 年的预测区间反映了不确定性,但技术进步的速度可能超出预期。 关键不在于 AGI 何时到来,而在于我们是否准备好了足够的安全框架来迎接它的到来。