PerceptionBench – 月之暗面开源的视觉感知诊断基准

📰 每日更新AI行业资讯,包含技术突破、产品发布、融资动态等热点内容

PerceptionBench是什么

PerceptionBench是月之暗面开源的视觉感知诊断基准。PerceptionBench 从 42 个现有评测集中前沿模型的失败案例中,归纳出 10 项原子视觉感知能力,并构建 3,000 道隔离式验证题,每题仅考察单一感知能力、无需推理或外部知识。测试显示,当前 16 个主流多模态模型无一达到 60% 准确率,揭示了原子级视觉感知仍是行业未解难题。

PerceptionBench

PerceptionBench的主要功能

  • 原子能力诊断:将视觉感知拆解为 10 项原子能力,包含视觉关系、计数、属性、深度、定位、组合、细粒度识别、上下文、OCR、幻觉,精确定位模型断裂点。
  • 隔离式评测:每道题目仅测试单一原子能力,避免推理与知识干扰,确保得分反映真实感知水平。
  • 失败案例归因:基于 42 个现有基准的失败案例分解出 1,800 道原子子问题,从真实错误中提炼评测维度。
  • 综合能力画像:通过 Leaderboard 展示模型在 10 项能力上的详细得分,揭示相似总分下截然不同的能力分布。
  • 开源可复现:提供完整代码、Hugging Face 数据集与论文,支持社区复现与扩展。

PerceptionBench的技术原理

  • 自底向上的错误分类法:通过诊断前沿 MLLM 在 42 个现有基准中的最早失败点,构建错误分类树,提取出感知分支的 10 项原子能力。
  • 难度分层与能力平衡:从内部 17,000+ 验证样本池中,按能力维度平衡与难度分层抽样 3,000 题,其中 60% 为失败案例分解的子问题,40% 为基于补充图像的新编题目。
  • 短答案无歧义设计:所有题目要求简短、明确的答案,降低评估不确定性,使自动化评测更可靠。
  • 感知-推理解耦:题目设计确保挑战来自视觉感知本身,而非推理链或领域知识,从而隔离测量感知边界。
挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用PerceptionBench

  • 克隆仓库:从 GitHub 拉取 MoonshotAI/PerceptionBench 开源代码。
  • 下载数据集:从 Hugging Face 获取 3,000 道验证题目与标注数据。
  • 接入模型:将待评测的多模态模型接入评测框架,按标准格式输出答案。
  • 运行评测:执行评测脚本,自动计算模型在 10 项原子能力及总体上的准确率。
  • 查看画像:对照 Leaderboard 分析模型能力短板,指导后续训练优化方向。

PerceptionBench的核心优势

  • 精准定位而非笼统打分:区别传统基准将感知、推理、知识混为一谈,PerceptionBench 能精确诊断模型到底在哪个感知环节出错。
  • 从真实失败中生长:从 42 个主流基准的真实失败案例中提炼,确保评测贴近实际模型弱点。
  • 暴露隐藏的能力鸿沟:相似总分的模型在原子能力上可能天差地别,PerceptionBench 的能力画像可揭示这些被总分掩盖的鸿沟。
  • 推动感知优先发展:将行业焦点从刷分、拉回、感知基本功,促进更忠实、更一致的视觉理解能力。

PerceptionBench的项目地址

  • 项目官网:https://www.kimi.com/blog/perception-bench
  • GitHub仓库:https://github.com/MoonshotAI/PerceptionBench
  • HuggingFace模型库:https://huggingface.co/datasets/moonshotai/PerceptionBench
  • 技术论文:https://github.com/MoonshotAI/PerceptionBench/blob/master/paper/PerceptionBench.pdf

PerceptionBench的同类竞品对比

维度 PerceptionBench MMMU / MMBench 等综合基准
评测目标 原子级视觉感知能力诊断 综合多模态理解与推理能力
题目规模 3,000 道验证题 MMMU 约 11.5K;MMBench 约 3.2K+
难度来源 纯视觉感知本身 感知 + 推理 + 领域知识混合
知识要求 无需外部知识或复杂推理 需大学级专业知识与多步推理
题目设计 每题仅隔离单一原子能力 多能力交织,综合考察
题目来源 42 个基准的失败案例分解 + 新编 大学教材、考试、在线资源、视频等
答案形式 简短明确,降低评估歧义 多选题或开放式,部分需复杂推导
输出价值 能力级诊断画像,定位感知断裂点 综合排名,衡量整体水平
适用阶段 模型研发期感知模块调优 模型发布后综合能力评估
核心洞察 相似总分模型能力分布可能天差地别 模型整体性能排序与差距量化

PerceptionBench的应用场景

  • 模型研发诊断:多模态团队在训练后使用 PerceptionBench 定位模型感知短板,针对性优化数据或架构。
  • 模型选型参考:企业用户根据业务所需的特定感知能力,对照能力画像选择最合适的商用模型。
  • 学术研究基准:作为标准评测工具发表多模态感知相关论文,提供可复现的实验环境。
  • 行业能力标准:为 MLLM 的视觉感知能力建立细粒度行业标准,替代粗放的”总分排名”文化。

0 条评论

点击更换头像
  • 暂无评论,快来发表第一条评论吧!

← 使用左侧菜单导航至其他页面