
MAC相關(guān)研究總結(jié)與核心部分翻譯一、文章主要內(nèi)容本文聚焦多模態(tài)大型語言模型(MLLMs)在科學理解能力評估方面的挑戰(zhàn),提出了一個動態(tài)演進的基準測試集MAC(Multimodal Academic Cover benchmark),并針對MLLMs跨模態(tài)科學推理能力不足的問題,設計了輕量級推理方法DAD(Description and Deduction)。1. 現(xiàn)有基準測試集的局限性靜態(tài)基準測試集(如MMMU)隨著MLLMs能力提升逐漸飽和,例如Gemini-2.5-pro在MMMU的pass@1設置下準確率已達81.7%,失去對模型發(fā)展的指導意義。現(xiàn)有動態(tài)基準測試集(如LiveBench)僅關(guān)注單一語言模態(tài),且依賴互聯(lián)網(wǎng)快速變化的內(nèi)容,在科學理解評估的數(shù)據(jù)質(zhì)量上存在隱患。2. MAC基準測試集的構(gòu)建與特點數(shù)據(jù)來源:從Nature、Science、Cell、美國化學學會(ACS)等頂級科學期刊中收集超過25,000個圖文對,涵蓋分子細胞生物學、材料科學、醫(yī)學、化學等多個學科領(lǐng)域。核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期間的2287個期刊封面-封面故事對,用于當前MLLMs的評估。任務設計:包含Image2Text(給定封面圖選對應封面故事)和Text2Image(給定