清华开源 Puro-2B:4400 美元训练,15 项任务平均指标超 Qwen2-1.5B!
清华大学团队推出全流程开源的Puro-2B模型,通过硬件、算法与数据的协同优化,以约4400美元预训练成本实现了超越Qwen2-1.5B的性能,显著降低了十亿级参数模型的训练门槛。
共 37 篇文章
从新到旧
清华大学团队推出全流程开源的Puro-2B模型,通过硬件、算法与数据的协同优化,以约4400美元预训练成本实现了超越Qwen2-1.5B的性能,显著降低了十亿级参数模型的训练门槛。
支付宝设立“智能体涌现奖”,每年投入1000万发展基金(含100万元年度大奖)激励开发者,并为优秀智能体提供接入阿宝面向10亿用户的服务分发与跨端互联支持。
中国电信星辰通用人工智能实验室开源1.2B参数文档解析模型TeleOCR,该模型在OmniDocBench v1.6榜单登顶并夺得ICDAR-2026科学图解析挑战赛冠军,能够统一处理数字与拍摄文档并将文字、版面、表格等转换为结构化结果。
570M 激活参数,将吞吐推向帕累托前沿。
无问芯穹联合清华大学、上海交通大学推出开源高性能具身端侧推理引擎APXInf,通过让Agent参与模型适配和优化流程,解决机器人量产部署中的算力、内存和时延难题,加速视觉语言大模型从云端到机器人本体的实际应用。
通过循环滑动窗口与结构状态传递,让页面之间拥有了“统一施工图”:模型在翻页时延续前文的结构状态,再将解析结果重建为完整文档树
夫夷以近,则游者众;险以远,则至者少
Convai Innovations 开源了非自回归决策模型 Laya,该模型以极低的推理延迟(33-38毫秒)和高效的并行处理能力,专为邮件分流、内容审核等快速分类与决策场景设计。
Qwen团队开源了7B参数的Qwen-Image-2.1模型,将文生图与图像编辑统一,原生支持透明图生成和最多10张参考图编辑,在保持高质量的同时优化了推理效率。
中电信发布新一代星辰大模型Xing4.0-29B-A4B,这款基于国产算力训练的MoE智能体大模型具备强大的任务规划与执行能力,通过量化技术可在消费级GPU上本地运行,在智能体评测中位列前三。
模型上新4202个、数据集上新826个、创新应用上新500个、应用文章发布25篇
云栖大会 Skill 上线,通过 Agent 智能助手帮助用户高效查询展馆展台、筛选订阅论坛、领取内容摘要,让参会者无论是否到现场都能轻松跟进2026云栖大会的精彩内容。
20 项基准上平均 83.9 分,保留全精度基线 98.2% 的能力,支持 262K token 上下文与图像输入;单张 RTX 5090 上解码最高约 143 tok/s,M5 Max 笔记本上约 47 tok/s
新学期,让AI作品成为实践成果!
紫东太初开源新一代通用多模态大模型ZDTaichu5.0-9B,支持文本、图像与视频输入,在九大空间理解基准中斩获8项第一,以自适应循环推理架构对标前沿闭源模型。
魔搭紫皮书V1正式上线,汇集开源模型社区实战经验,提供从环境搭建、模型微调到应用构建的可复现指南,邀您共建千行百业落地案例!
2026年9月魔搭AIGC专区原创作者激励榜单来啦!权益多多奖品多多~
上海人工智能实验室发布Atria Dawn Preview智能体基础模型,基于7440亿参数MoE架构,通过可验证经验流水线实现科研与工程任务的可执行、可验证结果产出。
基元律动联合多家机构开源面向 Agent 场景的 NeoHorse-1 模型(4B/9B),采用“Agent-Native”训练理念,利用真实任务执行轨迹与路由信号实现能力引导的数据配比及递归自我改进。
DeepSeek 开源 DeepSeek-V4.1-Flash:552B MoE 多模态模型,采用非对称架构大幅降低 KV Cache 至前代 1/4,支持百万级上下文与原生图文输入。