阅读,与值得关注的内容Readance

OpenAI发布ChatGPT Images 2.5图像生成与编辑模型,腾讯开源EVIE视觉文档检索模型

9 月 9 日,今天值得关注的项目覆盖图像编辑、文档检索、模型推理、三维场景与 Agent 开发:GPT-Image-2.5 提升多轮编辑的一致性,腾讯 EVIE 为复杂文档检索补充接入方式,Cohere 则开放了针对编码模型的推理加速引擎。本期同时收录近期公开的三维生成与搜索 Agent 项目。


🎨 图像生成与编辑


★ ChatGPT Images 2.5 / GPT-Image-2.5

根据文字和参考图生成、修改图像,在连续编辑中更好地保留人物、构图与视觉细节。

OpenAI 于 9 月 8 日发布 Images 2.5,重点改善参考图一致性、画面细节和多轮编辑。对于反复调整服装、商品背景或海报元素的工作流,这次更新着重减少修改局部时对原有画面的影响。

API 提供两个版本:Flare 面向速度与日常生成,Sunburst 面向更精细的编辑控制。官方报告,Flare 相比 GPT-Image-2 的生成延迟降低 50%;Sunburst 则更适合对连续修改要求较高的广告素材和商品视觉制作。

ChatGPT 端还加入 Sketch 草图引导与创作模板,可用简笔画表达布局,再结合文字完成图像。Images 2.5 正向各档用户逐步开放;开发者可通过 Image API 或 Responses API 接入生成与编辑能力。

上手门槛

开发接入:🟡 中|提供图像生成与编辑 API|可能需要完成组织验证

在线入口:https://chatgpt.com/

API 文档:https://developers.openai.com/api/docs/guides/image-generation

发布说明:https://openai.com/index/introducing-chatgpt-images-2-5/


📚 视觉文档检索


★ 腾讯 EVIE

直接检索包含文字、表格和图像的文档页面,并通过向量压缩降低索引存储成本。

腾讯 EVIE 面向复杂版式文档提供视觉检索能力,近期补充了 Sentence Transformers 接入方式。它将页面中的不同区域表示为多个向量,再与查询匹配,有助于保留表格结构、图表和小字号文字等细节,适合接入企业文档检索与知识库。

项目提供 8B 与 4.5B 两档模型。4.5B 版本支持在运行时选择 64—2048 维表示,并配合页面向量压缩,让开发者按检索质量和索引体积调整配置,无需为每种维度分别维护模型。

模型权重、训练流程、压缩算法与评测代码已公开,采用 Apache 2.0 许可证。实际接入时仍需建设页面索引和检索流程;EVIE 负责找到相关页面,后续答案生成可再连接业务中的问答模型。

上手门槛

自行部署:🟡 中|提供 4.5B、8B 权重|需接入多向量索引与检索流程

4.5B 权重:https://huggingface.co/tencent/EVIE-4.5B

8B 权重:https://huggingface.co/tencent/EVIE-8B

项目地址:https://github.com/Tencent/EVIE


⚡ 模型推理加速


★ Cohere Megakernel

把编码模型的完整解码过程整合进一个 CUDA 内核,减少 GPU 调度开销。

Cohere 于 9 月 8 日公开 Megakernel 推理引擎,当前针对 North Mini Code 优化。它用持续运行的 GPU 内核执行完整解码过程,减少多个算子之间反复启动与调度的开销,重点服务小批量、低延迟的编码模型请求。

项目方报告,在单张 H100、BF16 精度的指定服务测试中,相比 vLLM v0.24 可获得约 1.25—1.41 倍加速。这一数字对应官方测试条件,实际收益仍取决于请求长度、并发量和服务配置。

引擎提供 OpenAI 兼容接口,支持工具调用、连续批处理和分页 KV 缓存。代码采用 Apache 2.0 许可证开放,但目前仍是针对特定模型与 H100 的早期实现,适合已有相应硬件、希望优化编码服务延迟的团队评估。

上手门槛

自行部署:🔴 高|当前针对 H100 与 North Mini Code|需编译专用 CUDA 内核

源码与部署说明:https://github.com/cohere-ai/cohere-megakernel

技术介绍:https://cohere.com/blog/megakernels


🧊 三维场景生成


★ WorldSculpt

结合多视角图像与物体标注,生成由独立物体网格组成的复杂三维场景。

Alaya Lab 与东京大学的 WorldSculpt 近期公开了推理代码和模型权重。它将复杂场景组织为物体级三维网格,使场景中的各个物体能够分别进入后续编辑与资产处理流程。项目展示了包含数百个物体的场景结果。

方法以 Pixal3D 的单物体生成能力为基础,适配遮挡条件下的多视角输入,再组合出完整场景。官方还展示了将 Marble 生成的三维高斯场景转换为物体级网格的应用,为已有三维世界补充可操作的几何资产。

当前流程需要RGB 图像、实例掩码和三维框,适合已有场景标注或预处理能力的三维开发团队。部署时需加载 WorldSculpt 与 Pixal3D 配套权重,并按官方流程准备 GPU 算子与输入数据。

上手门槛

自行部署:🔴 高|需编译 GPU 算子并加载配套权重|输入需含实例掩码和三维框

模型权重:https://huggingface.co/AlayaLab/WorldSculpt

项目地址:https://github.com/AlayaLab/WorldSculpt

效果展示:https://alaya-lab.github.io/WorldSculpt/


🔎 搜索 Agent


★ Iris-mini / Iris-pro

围绕多轮搜索与证据判断训练 Agent,持续检索、阅读并决定何时结束搜索。

AllSpark Research 近期公开 Iris 搜索 Agent 系列,提供 mini 与 pro 两档权重。模型围绕完整搜索过程训练:选择查询、阅读返回内容、判断是否继续,以及在证据足够时形成答案,适合需要跨页面查证的复杂信息检索任务。

Iris-mini 的总参数为 35B、激活参数为 3B;Iris-pro 的总参数为 397B、激活参数为 17B,两者均提供 256K 上下文。项目同时公开 Iris-Harness,包含搜索工具、Agent 循环与上下文管理策略,可连接 OpenAI 兼容模型服务。

长任务中如何处理累积的工具历史,会明显影响搜索表现。因此,官方同时报告不同上下文管理设置下的结果,使用时应把模型与运行框架一起评估。模型权重与评测框架已公开,数据构建和训练流水线尚未发布

上手门槛

自行部署:🔴 高(mini)/🔴 极高(pro)|总参数分别为 35B、397B|需结合搜索工具运行,mini 官方示例采用四卡并行

mini 权重:https://huggingface.co/AllSpark-Research/Iris-mini

pro 权重:https://huggingface.co/AllSpark-Research/Iris-pro

项目地址:https://github.com/AllSpark-Research/Iris


🛠️ Agent 开发


★ Pydantic AI v2.41.0

通过统一的 Python 接口调用图像生成,并为 Agent 增加 ChatGPT/Codex 订阅认证接入。

Pydantic AI 于 9 月 8 日发布 v2.41.0,新增直接图像生成接口 ImageGenerator。开发者可以在应用中直接组织图像请求,将生成结果纳入已有内容生产或多模态工作流。

这一版本还新增 openai-codex provider,支持 ChatGPT/Codex 订阅认证。对于已经使用 Pydantic AI 构建 Agent 的开发者,更新补充了模型接入选择;具体可用模型、额度和调用条件仍由对应服务决定。

项目采用 MIT 许可证,发行包已上架 PyPI。此次更新适合需要把图像能力加入 Python 应用,或希望在现有 Agent 中接入相应订阅认证的团队。

上手门槛

开发接入:🟢 较低|提供 Python SDK|图像能力取决于所接模型服务的权限与计费

安装入口:https://pypi.org/project/pydantic-ai/2.41.0/

图像生成文档:https://pydantic.dev/docs/ai/guides/image-generation/

版本说明:https://github.com/pydantic/pydantic-ai/releases/tag/v2.41.0

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →