共 28 篇文章
从新到旧
梁文锋署名,DeepSeek 晒出 38 万沙盒的 Agent 训练场
GPU 算梯度,沙盒让 Agent 真正动手。
小米 MiMo-V2.6 技术报告深度解读
Pro 与 Flash 的进步背后,小米怎样让大规模 Agent RL 真正学到有效信号?
小米开源 MiMo-V2.6 双模型,罗福莉:我们选了最难的那条路
MiMo-V2.6:Scaling Up RL 的艰难之路
Jev 入门指南:System One 模型能做什么
认识 Jev
苏剑林解构Scaling Law:优化、架构、数据的三重奏
从三种误差理解大模型训练的规模规律
万字长文读懂 RSI
一份梳理Agent自我改进路线的研究图谱
DeepSeek V4.1 Flash 技术报告英中对照版来了。。。
英中双语对照 PDF
DeepSeek-V4.1-Flash技术报告深度解读:长程 Agent 如何重新分配预算
持久缓存压到原来的约八分之一
谷歌 DeepMind 放出一张 1PB 基因图谱,90 亿种 DNA 变化全覆盖
90 亿种可能的单字母 DNA 变化的预测影响提前算好
1 万个 Agent,88 小时:OpenAI 公布千禧年难题解法
解题时发了270万条消息
Codex爆了!50w+下载量科研skills全开源!
科研 Skill
重新思考 GPT-6 Astra 的 Skills 和提示词
为旧模型攒下的规则,可能正在拖慢 GPT-6 Astra
GPT-6 Astra 最佳实践,OpenAI 这份指南讲得很细
GPT-6 Astra 官方指南
GPT-6 Astra 实测,34 分钟帮我做了一个本地 PDF 工具
34 分钟复刻 iLovePDF
清华姚班校友主导,Claude 用 11 天完成费马大定理形式化证明
一度被当成民科来信
Anthropic 发布 AI 原生软件开发实战手册
代码变快以后人类流程成了新瓶颈
GPT-6 Astra 来了:100 万上下文,Codex 开始有记忆了
电脑操作少花近一半时间
重磅!Anthropic 电商 Agent 实战指南发布了!
单 Agent 加 Skills 是生产主线
Gemini 3.8 Flash 来了:价格没涨,开始死磕长任务
六周连发三个 Flash 版本