当前位置: 首页 > news >正文

视觉大模型评测数据集

1.A-bench

benchmark地址:https://github.com/Q-Future/A-Bench
数据集地址:https://huggingface.co/datasets/q-future/A-Bench/tree/main

A-Bench数据集用来测试大模型是否能评估由AI生成的图片,它测试模型2方面的能力,语义理解和质量感知。

A-Bench-P1 → 高级语义理解,A-Bench-P2 → 低级质量感知。对于高级语义理解,A-Bench-P1针对三个关键领域:基本识别、词袋陷阱辨别和外部知识实现,旨在逐步测试 LMM 在 AIGI 语义理解方面的能力,从简单到复杂的提示相关内容。对于低级质量感知,A-Bench-P2专注于技术质量感知、美学质量评估和生成性扭曲评估,旨在涵盖常见的质量问题和 AIGI 特定的质量问题。

具体来说,我们编制了一个包含 2,864 个 AIGI 的综合数据集,这些 AIGI 来源于各种 T2I 模型,其中包括 1,408 个A-Bench-P1 AIGI和 1,456 个A-Bench-P2 AIGI 。每个 AIGI 都与一个由人类专家注释的问答集配对。

2.AI2D

数据集地址
ai2d: https://huggingface.co/datasets/lmms-lab/ai2d
ai2d-mo-mask:https://huggingface.co/datasets/lmms-lab/ai2d-no-mask
AI2 Diagrams (AI2D) 是一个包含超过 5000 个小学科学图表的数据集,具有超过 150000 个丰富的注释、它们的基本事实句法解析以及超过 15000 个相应的多项选择题

3.AesBench

benchmark地址: https://github.com/yipoh/AesBench
数据集地址:

旨在全面评估 MLLM 的审美感知能力的专家基准
多模态大型语言模型 (MLLM) 正在蓬勃发展,促进了日常生活中的人机交互和协作。然而,它们在理解图像美学方面的能力在很大程度上仍未被探索。这可能会阻碍高级 MLLM 在现实世界场景中的应用,例如艺术设计和图像生成。为了解决这一难题,我们引入了 AesBench,这是一个专家基准,用于系统地评估 MLLM 的美学理解能力。在该基准中,首先从美学专家那里收集高质量的注释,并在此基础上构建美学理解基准数据集。此外,我们设计了一套综合标准,从四个由浅入深的视角评估 MLLM,包括感知 (AesP)、同理心 (AesE)、评估 (AesA) 和解释 (AesI)。我们希望这项工作可以鼓励社区更深入地研究 MLLM 在图像美学理解中尚未开发的潜力。

4.BLINK

benchmark地址:https://github.com/zeyofu/BLINK_Benchmark
数据集地址:https://huggingface.co/datasets/BLINK-Benchmark/BLINK
这是多模态语言模型 (LLM) 的新基准,其专注于其他评估中未发现的核心视觉感知能力。大多数BLINK任务可以由人类“在一眨眼之间”解决(例如,相对深度估计、视觉对应、取证检测和多视图推理)。然而,我们发现这些对感知要求高的任务对当前的多模态 LLM 提出了重大挑战,因为它们拒绝通过自然语言进行调解。BLINK将 14 个经典计算机视觉任务重新格式化为 3,807个多项选择题,搭配单张或多张图像和视觉提示。虽然人类的平均准确率为 95.70%,但BLINK对现有的多模态 LLM 来说却极具挑战性:即使是表现最好的 GPT-4V 和 Gemini 也只达到了 51.26% 和 45.72% 的准确率,仅比随机猜测高 13.17% 和 7.63%,这表明这种感知能力尚未在近期的多模态 LLM 中“出现”。我们的分析还强调,专业的计算机视觉模型可以更好地解决这些问题,并指出了未来改进的潜在途径。我们相信,BLINK将激励社区,帮助多模态法学硕士 (LLM) 赶上人类的视觉感知水平

http://www.dtcms.com/a/328048.html

相关文章:

  • [SC]如何使用sc_semaphore实现对共享资源的访问控制
  • LeetCode 2787.将一个数字表示成幂的和的方案数:经典01背包
  • 电机极数2极、4极、6极、8极的区别
  • Vue接口平台小功能——发送报告到飞书
  • 【KO】android 面试 算法
  • 数据分析学习总结之实例练习(双十一淘宝美妆)
  • MySQL 索引算法
  • 基于Hadoop的汽车价格预测分析及评论情感分析可视化系统
  • 基于SpringBoot的旅游网站系统
  • 码上爬第六题【协程+AES解密+请求参数加盐】
  • Android 项目:画图白板APP开发(一)——曲线优化、颜色、粗细、透明度
  • 需求分发机制如何设定
  • mssql server2016升级到2019报msoledbsql.msi文件错误
  • 白板功能文档
  • golang的继承
  • [Metrics] RMSE vs ADE
  • 衡量机器学习模型的指标
  • 【基于Redis的手语翻译序列存储设计】
  • Ansible 自动化介绍
  • 飞算AI:企业智能化转型的新引擎
  • react+Zustand来管理公共数据,类似vue的pinia
  • React 腾讯面试手写题
  • Orange的运维学习日记--40.LNMP-LAMP架构最佳实践
  • 【前端:Html】--3.进阶:图形
  • [激光原理与应用-252]:理论 - 几何光学 - 传统透镜焦距固定,但近年出现的可变形透镜(如液态透镜、弹性膜透镜)可通过改变自身形状动态调整焦距。
  • 虚拟机环境部署Ceph集群的详细指南
  • 「让AI大脑直连Windows桌面」:深度解析Windows-MCP,开启操作系统下一代智能交互
  • Hi3DEval:以分层有效性推进三维(3D)生成评估
  • 【树状数组】Range Update Queries
  • 《Leetcode》-面试题-hot100-栈