- SignalDesk1 hr ago
Perceptron 推出全新的 Mk1.5 模型 一个专门为“具身智能”(比如无人机、机器狗、智能眼镜、智能手机等)量身定制的“超级大脑” 它能让物理设备能够真正看懂、听懂周围的世界,并自主完成任务,而且不需要针对每种设备去重新训练 Mk1.5 能够把物体当作一个连续的实体,在整个视频里“死死盯住”它,而不是像现在的普通模型逐帧截图理解... 普通多模态模型,你给它一张图片,它只能告诉你: “桌子上有一个红色杯子。” Mk1.5 可以: “红色杯子在画面左侧这个位置” “它从第 3 秒移动到了第 8 秒” “它现在被手拿起来了” “继续跟踪这个杯子” “控制无人机靠近它” “检查它后面有没有其他物体。 也就是说,它关注三个连续过程: 看见 → 理解 → 行动。 Mk1.5 加入了几个非常关键的新能力: - 原生音频理解 - 视频物体持续追踪 - Tool Calling - Web Search - Sub-agent - 更复杂的视觉推理 - 推理速度提升约 2 到 5 倍 它可以实现以下能力: 视频里的“追踪大师”: 以前的 AI 看视频往往是一张一张截图去认,但 Mk1.5 能够把物体当作一个连续的实体,在整个视频里“死死盯住”它。这个能力对于自动盘点库存、或者分析体育比赛特别有用。在视频对象分割的测试中,它拿下了四项测试中的三项第一。 懂你的“第一人称”视角: 如果你戴着智能眼镜,它能非常精准地看懂你在看什么、你的手在干嘛。官方测试显示,它在第一人称视频里定位手部动作的能力,比他们测试的最强 Gemini 模型还要高出 50%。 终于“长耳朵”了: Mk1.5 增加了原生的音频支持。它现在不仅能看字看图看视频,还能直接听声音。这让它可以实现语音转写、或者通过声音来判断周围发生了什么事件。 会自己找工具,还能“摇人”分工: 这是它非常聪明的一点。遇到不懂的问题,它会自己去调用外部工具(比如用谷歌搜网页、反向搜图等)。更厉害的是,它还能召唤“子代理(sub-agents)”,把一个复杂任务拆分出去多线并行处理,大幅提高效率。 脑子转得飞快,且依然学霸: 相比上一代 Mk1,它的反应速度快了 2 到 5 倍(比如纯聊天回复快了 4.7 倍,看图问答快了 3.3 倍)。更难得的是,在速度飙升的同时,它的视觉和视频推理能力依然保持在行业最前沿,甚至在某些测试上超越了 GPT-5 和最新的 Gemini。 开发者的福音(便宜又好用): 开发者现在就可以通过 API 接入这个模型。它支持 3.2 万(32K)Token 的上下文,而且价格非常香:每 100 万个输入 Token 只要 0.15 美元,输出也只要 1.50 美元。 Perceptron AI : Today we're releasing Mk1.5: a new intelligence layer for embodied agents. It flies drones, controls quadrupeds, powers smart glasses, tracks objects, searches the web, reasons visually, and dispatches its own sub-agents. One model, no platform-specific retraining. 🧵 Link: https://x.com/perceptroninc/status/2103508527813669193
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:AI / AI前沿 / 小互 @xiaohu
- 发布时间:2026/9/26 09:49:17
- No replies yet