基于 Qwen3.5 与 MLX 实现的 Jev-like 视觉推理实验,通过共享多模态上下文与候选答案直接打分,让小型视觉语言模型在 Apple Silicon 上高效完成批量视觉决策。
Jev Visual 是一个面向 Apple Silicon 的开源视觉推理实验项目,尝试用开放权重视觉语言模型复现一种 Jev-like 的视觉决策范式。
项目基于 Qwen3.5-0.8B + MLX,核心思路不是让模型针对每个问题分别进行自回归生成,而是:
图像 + 公共上下文 → 一次 Prefill → 复用模型状态 → 批量处理多个问题 → 直接从 logits 对候选答案打分
例如,同一张图片需要同时判断物体类别、位置、状态等几十个问题时,可以复用视觉编码和公共上下文,而不是重复处理整张图片。
项目目前支持:
为了验证这种推理方式,我还实现了几个实时视觉 Demo,包括 AI 分拣工厂、视觉控制打砖块、摄像头手势识别等。
在 M4 / 16GB Mac 上的实验中,当一次处理 64 个视觉决策时,独立候选评分耗时约 37.3 秒,共享上下文后的批量评分约 2.4 秒。这个 Benchmark 主要用于验证 shared-context 推理的扩展性,并不代表模型准确率提升。
这个项目并不是 TypeSafe Jev 官方模型的复现,也没有复现其 RLCD 训练、校准或 Serving 系统,而是一个基于开放模型探索 “视觉模型是否一定需要通过生成来完成决策” 的工程实验。