
MMBench
MMBench是上海人工智能实验室推出的多模态大模型评测基准,用于评估模型的图像理解、视觉推理、多模态问答和跨模态理解能力。MMBench广泛应用于多模态模型研发、性能测试和模型对比分析场景。
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造公正、可信、科学、全面的评测生态,以“评测助力,让AI成为人类更好的伙伴”为使命。专门设计用于评估基础模型在人类认知和问题解决相关任务中的一般能力。






