行业资讯

  • Home
  • DeepSeek Harness RC.8发布:多模态与子代理能力成焦点

DeepSeek Harness RC.8发布:多模态与子代理能力成焦点

2026-08-20 9221

近日,DeepSeek Harness 推出 v0.1.0-rc.8,这也是公测后首个重要迭代。本次更新包含14项改进,重点在于多模态输入的补齐,同时对子代理协作、终端体验、工具调用与开发者兼容性等方面进行了完善和修复。

新版允许原生图片请求并支持图文混合输入,常用命令如 /goal、/plan 已能直接接收图片内容。输入框的 @ 菜单新增了文件与会话引用,用户可以将本地文件或已有对话拉入当前任务,使原本以文本、代码和工具为主的 Agent 工作流更容易纳入截图、界面图和其他视觉素材。

子代理生态也得到扩展:现在可以按需安装 Claude Code 和 Codex 作为 Profile Bundle。Codex 支持非交互权限模式并可创建多个命名实例,便于在同一任务中配置不同的 Codex 子代理。针对 Windows 用户,终端体验也有所提升:PTY 终端加入了持久化的 PowerShell 会话,并在极简模式预设中默认开启,减少反复重建终端环境带来的中断。

本次更新同时修复了多项公测期间暴露的问题。例如,单张大图或历史会话中图片过多可能导致模型请求失败的问题已被处理;取消流式生成后回复前缀未能正确沿用到下一轮或分叉会话的缺陷也已修正;对于使用自定义 OpenAI 兼容网关的场景,因请求格式差异导致无法调用或推理结果回传缺失的问题也做了兼容性修复。

一项引人注意的实现细节是,即便所调用的基础模型并不原生支持图像输入,Harness 也能通过工具链退化出“工具层视觉”。在直接调用图像输入失败时,系统会转而对图片执行 OCR、颜色比例统计、像素行扫描并读取尺寸与色彩模式等元信息,将这些结构化数据交由文本大模型推理。对 PPT 截图、流程图、界面截图这类结构化或含文字的图像,这种方法能提取出大量有用信息;但面对真实照片或复杂空间关系时,工具链恢复的视觉信息仍有明显局限。

社区对此次更新反应热烈,国内外开发者都将注意力集中在多模态支持与更完善的子代理集成上。自公测开启以来,用户已用该平台完成诸如长文档翻译、小游戏开发等多样任务,而这次对视觉输入与协作机制的补强,进一步扩展了 Agent 在实际工作流中的适用范围。

发表评论