
MAC相關(guān)研究總結(jié)與核心部分翻譯一、文章主要內(nèi)容本文聚焦多模態(tài)大型語言模型(MLLMs)在科學(xué)理解能力評估方面的挑戰(zhàn),提出了一個動態(tài)演進的基準測試集MAC(Multimodal Academic Cover benchmark),并針對MLLMs跨模態(tài)科學(xué)推理能力不足的問題,設(shè)計了輕量級推理方法DAD(Description and Deduction)。1. 現(xiàn)有基準測試集的局限性靜態(tài)基準測試集(如MMMU)隨著MLLMs能力提升逐漸飽和,例如Gemini-2.5-pro在MMMU的pass@1設(shè)置下準確率已達81.7%,失去對模型發(fā)展的指導(dǎo)意義?,F(xiàn)有動態(tài)基準測試集(如LiveBench)僅關(guān)注單一語言模態(tài),且依賴互聯(lián)網(wǎng)快速變化的內(nèi)容,在科學(xué)理解評估的數(shù)據(jù)質(zhì)量上存在隱患。2. MAC基準測試集的構(gòu)建與特點數(shù)據(jù)來源:從Nature、Science、Cell、美國化學(xué)學(xué)會(ACS)等頂級科學(xué)期刊中收集超過25,000個圖文對,涵蓋分子細胞生物學(xué)、材料科學(xué)、醫(yī)學(xué)、化學(xué)等多個學(xué)科領(lǐng)域。核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期間的2287個期刊封面-封面故事對,用于當前MLLMs的評估。任務(wù)設(shè)計:包含Image2Text(給定封面圖選對應(yīng)封面故事)和Text2Image(給定