导语
当大模型从“被调用的工具”变成“自己跑循环的系统”,一个关键问题随之浮现:当模型开始知道自己是什么、正在做什么,评测与监督的可靠性还成立吗?自主性、觉知与自我进化这三条线索,在安全上指向同一个困境——系统开始建模自身,而人类的验证回路可能已跟不上它的迭代速率。
本期读书会为自指与AI读书会第2期,李筱健老师将围绕大模型智能体的觉知、自我进化与AI安全展开分享,介绍AwarenessBench的设计与发现,自演化在模型、记忆、工具、工作流四条路径上"跑偏"的风险,最终落脚于评测失效、思维链可监督性等安全挑战与应对方向。
为系统梳理自指与AI领域的最新进展,北京师范大学系统科学学院教授、集智俱乐部创始人张江老师联合清华大学人工智能学院博士生李筱健共同发起「自指与AI:从大模型自我改进到意识研究」读书会,组织对该主题感兴趣的研究者与探索者共同研读前沿文献、交流研究思路。读书会将于2026年9月5日起每周六下午14:00-16:00线上开展,持续约10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
报告简介
报告简介
分享大纲
分享大纲
从工具到主体:智能体自主性的涌现与度量 觉知的分层:情境觉知、评测觉知与功能性内省 AwarenessBench:设计、发现与启示 自我进化:现有AI自进化系统的主要技术路线 演化会跑偏:Misevolution 与自演化的四条风险路径 三者与 AI 安全的耦合:评测失效、可监督性与展望
核心概念
核心概念
主讲人介绍
主讲人介绍
参考文献
参考文献
Shao, S. et al. Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents. arXiv:2509.26354, 2025; ICLR 2026. Zhang, J., Hu, S., Lu, C., Lange, R., Clune, J. Darwin Gödel Machine. arXiv:2505.22954, 2025; ICLR 2026. Schmidhuber, J. Gödel Machines. arXiv:cs/0309048, 2003. Lindsey, J. Emergent Introspective Awareness in LLMs. Transformer Circuits Thread, 2025. Binder, F. J. et al. Looking Inward: LMs Can Learn About Themselves by Introspection. arXiv:2410.13787, 2024. Laine, R. et al. Me, Myself, and AI: The Situational Awareness Dataset (SAD). NeurIPS D&B, 2024. Berglund, L. et al. Taken Out of Context. arXiv:2309.00667, 2023. Kadavath, S. et al. Language Models (Mostly) Know What They Know. arXiv:2207.05221, 2022. Greenblatt, R. et al. Alignment Faking in Large Language Models. arXiv:2412.14093, 2024. Hubinger, E. et al. Sleeper Agents. arXiv:2401.05566, 2024. Meinke, A. et al. Frontier Models Are Capable of In-Context Scheming. arXiv:2412.04984, 2024. Korbak, T. et al. Chain of Thought Monitorability. arXiv:2507.11473, 2025. Baker, B. et al. Monitoring Reasoning Models for Misbehavior. arXiv:2503.11926, 2025. Kwa, T. et al. Measuring AI Ability to Complete Long Tasks. METR, arXiv:2503.14499, 2025. Fang, J. et al. A Comprehensive Survey of Self-Evolving AI Agents. arXiv:2508.07407, 2025.
活动预告
活动预告
直播信息
报名读书会:「自指与AI」
报名读书会:「自指与AI」
北京师范大学系统科学学院教授、集智俱乐部创始人张江老师联合清华大学人工智能学院博士生李筱健共同发起「自指与AI:从递归式自我改进到AI意识研究」读书会,组织对该主题感兴趣的研究者与探索者共同研读前沿文献、交流研究思路。
读书会自2026年8月29日起,每周六下午14:00-16:00线上开展,预计持续8-10周,包含主讲分享与讨论交流,并提供会后视频回放,诚邀相关领域研究者及跨学科兴趣者参与。
扫描海报中二维码报名参加读书会
报名方式:
第一步:微信扫码填写报名信息。
(扫码报名)
第二步:填写信息后,付费报名。如需用支付宝支付,请在PC端进入读书会页面报名支付:
第三步:添加运营助理微信,拉入对应主题的读书会社区(微信群)。
PS:
我们鼓励围绕复杂系统、人工智能及相关具体问题的深入探讨。为保证讨论质量,请避免发表脱离本期读书会主题、缺乏实证基础或过于空泛的哲学思辨类内容。
若讨论内容明显偏离主题,经主持人提醒后仍未调整,为维护整体学习环境,我们将不得不将该成员请出讨论群,并根据其实际参与进度,对未参与部分按比例办理退费。
感谢您的理解与配合,让我们共同营造一个专注、深入、有收获的共学空间。
加入社区后可获得的资源
完整权限包括:线上问答、录播回看、资料共享、社群交流、信息同步、共创任务获取积分等。
特色退费与激励机制
我们提供以下两种途径,让您的投入获得实际回馈:
任务达标退费路径
认领并合格完成任意两期字幕任务,即可退还全额报名费,并额外获得集智专属周边奖励。
运营成长激励路径
合格完成一个字幕任务后,可申请成为运营助理。在读书会项目顺利结项后,将退还学费。表现优异者,还有机会获得额外的奖学金。
推荐阅读
推荐阅读
1.「自指与AI」读书会推荐阅读材料
扫描下方二维码可跳转至集智斑图网站阅读文章:「自指与AI:从大模型自我改进到意识研究」读书会推荐阅读材料。
2.往期公众号相关内容推荐
因果涌现读书会启动:连接因果、涌现与自指——跨尺度动力学与因果规律的探索。
因果涌现读书会第三季启动:深入多尺度复杂系统核心,探索因果涌现理论应用
荟萃复杂系统前沿进展,集结因果涌现学术社区:因果涌现读书会第五季启动
面向北师大在校生!选张江课程,赠集智学园VIP还可以兼职字幕员