MMLU測試AI在人文、科學、社會科學等多領域的廣泛知識;GSM8K是基礎數學文字題;MATH是競賽等級數學題;C-Eval則是中文多學科、多難度的評測套件。這4個是 iPAS AI應用規劃師考試常考的LLM評測資料集(benchmark),這篇用漫畫圖解+官方考題解析,帶你一次分清楚每個資料集分別在測什麼。
LLM 評測資料集四兄弟
MMLU × GSM8K × MATH × C-Eval:到底各自拿來考 AI 什麼?
🎬 第一幕:AI 期末考來了!
歷史、法律、科學、人文……
→ MMLU小學數學 vs 競賽數學
→ GSM8K / MATH中文多學科知識
→ C-Eval🧠 先用一句話分清楚
| 資料集 | 白話 | 主要測什麼? | 記憶法 |
|---|---|---|---|
| MMLU | 🌍「什麼都考一點」 | 多領域、多任務的廣泛知識與理解 | 🌍 廣度 |
| GSM8K | 🧮「小學數學應用題」 | 基礎數學文字題與多步驟推理 | 🧮 基礎數學 |
| MATH | 🏆「數學競賽考題」 | 較進階、競賽等級的數學問題解題能力 | 🏆 高難數學 |
| C-Eval | 🇨🇳「中文多科目大會考」 | 中文、多學科、多難度的基礎模型評測 | 🇨🇳 中文多科 |
🌍 第二幕:MMLU——AI 的「綜合能力大學聯考」
📚 MMLU
Massive Multitask Language Understanding
MMLU 是用多項選擇題測試大型語言模型廣泛知識與推理能力的 benchmark,涵蓋 57 個學科/任務,範圍包含 STEM、人文、社會科學與專業領域。
多領域 多任務 多選題🎭 漫畫情境
🤖:「全部一起來?!」
👉 MMLU 的重點就是廣泛、多領域的語言理解與知識能力。
🧮 第三幕:GSM8K——AI 的「小學數學應用題老師」
📐 GSM8K
Grade School Math 8K
GSM8K 是約 8.5K 道高品質、語言多樣的小學/基礎數學文字題,主要用來測試需要多步驟計算的數學問題解答能力;典型題目約需 2~8 個步驟。
文字數學題 基礎算術 多步驟🍎 漫畫情境
老師:「小明有 3 顆蘋果,再買 5 顆……最後有幾顆?」
👉 不是考 AI 的法律知識,也不是奧林匹克數學,而是看 AI 能不能把生活文字題轉成正確的數學步驟。
🏆 第四幕:MATH——AI 的「數學競賽地獄關」
📚 MATH
Measuring Mathematical Problem Solving
MATH 是包含 12,500 道競賽數學問題的 benchmark,涵蓋代數、幾何、數論、計數與機率、微積分前置等不同主題與難度,並提供逐步解答。
競賽數學 高難度 數學推理🎭 漫畫情境
老師:「這次不是 3+5。」
「來解代數、幾何、數論、機率!」
🤖:「等等……這已經是競賽題了!」
👉 MATH 比 GSM8K 更偏向進階、競賽級數學推理。
🇨🇳 第五幕:C-Eval——中文世界的「多科大會考」
📖 C-Eval
A Multi-Level Multi-Discipline Chinese Evaluation Suite
C-Eval 是針對 foundation models 的中文、多層級、多學科評測套件,共 13,948 題選擇題,涵蓋 52 個學科與 4 個難度等級。
中文 52 學科 4 難度🎭 漫畫情境
老師:「國文、歷史、法律、醫學、工程……通通來!」
👉 C-Eval 的重點不是單純「中文聊天」,而是以中文、多學科、多難度的題目評估模型能力。
🥊 第六幕:四個資料集正面對決
| 資料集 | 像什麼考試? | 主要領域 | 最重要關鍵字 | 不要搞錯 |
|---|---|---|---|---|
| MMLU | 🌍 綜合大考 | 人文、社科、STEM、專業等 | 多領域、多任務 | 不是專門數學題庫 |
| GSM8K | 🧮 小學數學應用題 | 基礎數學文字題 | 多步驟數學推理 | 不是競賽級數學 |
| MATH | 🏆 數學競賽 | 代數、幾何、數論、機率等 | 進階數學推理 | 不是一般多領域知識 |
| C-Eval | 🇨🇳 中文多科大會考 | 52 個中文學科 | 中文、多學科、多難度 | 不是只考中文語文 |
🏢 第七幕:套進你熟悉的「能源管理 AI」
情境 ①「AI 懂不懂各領域?」
拿 AI 去回答能源、法律、歷史、電腦科學、經濟等不同領域問題。
👉 想測「廣泛能力」→ MMLU
情境 ②「AI 會不會算?」
給 AI 一個「大樓電費+設備數據」的基礎數學應用題,要求多步驟算出答案。
👉 想測「基礎數學推理」→ GSM8K
情境 ③「AI 能不能解難題?」
要求 AI 解代數、幾何、機率等競賽等級數學。
👉 想測「進階數學推理」→ MATH
情境 ④「AI 懂不懂中文專業知識?」
用中文題目測試不同學科與不同難度的知識。
👉 想測「中文多學科能力」→ C-Eval
🧠 iPAS 考前超強記憶法
🧮 GSM8K=「基礎數學應用題」
🏆 MATH=「競賽數學」
🇨🇳 C-Eval=「中文多學科」
⭐ 一秒判斷:
「多領域」→ MMLU
「小學/基礎數學」→ GSM8K
「競賽/高難數學」→ MATH
「中文+多學科」→ C-Eval
🎯 最後來做你給的這一題!
下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專用於數學推理或中文專業知識?
A. MMLU
B. GSM8K
C. MATH
D. C-Eval
🔍 題目看到「多領域、多任務」+「人文、科學、社會科學」,就要想到 MMLU。
❌ GSM8K → 數學文字題
❌ MATH → 競賽數學推理
❌ C-Eval → 中文、多學科評測
✅ MMLU → 廣泛、多領域、多任務的知識與理解評測。
🌍 廣度 → MMLU | 🧮 數學 → GSM8K/MATH | 🇨🇳 中文多科 → C-Eval
📌 考前最後一張小抄
| 看到題目關鍵字 | 答案 |
|---|---|
| 「多領域、多任務、人文、科學、社會科學」 | 🌍 MMLU |
| 「小學數學、文字題、基本算術、多步驟」 | 🧮 GSM8K |
| 「競賽數學、代數、幾何、數論、高難度」 | 🏆 MATH |
| 「中文、多學科、52 學科、4 難度」 | 🇨🇳 C-Eval |
⭐ 最終口訣:
「MMLU 看廣度,GSM8K 看基礎數學,MATH 看競賽數學,C-Eval 看中文多科。」
資料依 MMLU、GSM8K、MATH、C-Eval 公開資料/論文整理。MMLU 為 57 個學科/任務的多選題 benchmark;GSM8K 約 8.5K 基礎數學文字題;MATH 為 12,500 道競賽數學問題;C-Eval 為 13,948 題、52 學科、4 難度的中文多學科評測。
常見問題 FAQ
MMLU是什麼?
MMLU(Massive Multitask Language Understanding)是用多項選擇題測試大型語言模型廣泛知識與推理能力的評測集,涵蓋57個學科/任務,範圍包含STEM、人文、社會科學與專業領域。重點是「廣度」,不是專門的數學題庫。
GSM8K是什麼?
GSM8K(Grade School Math 8K)是約8.5K道小學/基礎數學文字題,主要測試AI需要多步驟計算的數學應用題解答能力,典型題目約需2到8個步驟。重點是「基礎數學推理」,不是競賽級數學。
MATH是什麼?
MATH是包含12,500道競賽數學問題的評測集,涵蓋代數、幾何、數論、計數與機率、微積分前置等主題與難度,並提供逐步解答。比GSM8K更偏向進階、競賽等級的數學推理能力。
C-Eval是什麼?
C-Eval是針對基礎模型的中文、多層級、多學科評測套件,共13,948題選擇題,涵蓋52個學科與4個難度等級。重點不是單純的中文語文能力,而是用中文題目評估模型的多學科、多難度知識能力。
iPAS AI應用規劃師考試會怎麼考這4個資料集?
常見題型會描述評測的特徵(例如「多領域、多任務」「人文、科學、社會科學」),要求判斷是哪個資料集。判斷關鍵字:看到「多領域、多任務」選MMLU;看到「小學、基礎數學、文字題」選GSM8K;看到「競賽、高難度數學」選MATH;看到「中文、多學科、多難度」選C-Eval。
想進一步掌握生成式AI與機器學習的完整概念,可以搭配 CoT和ToT差在哪裡?Prompt Engineering技巧總整理、RAG和Temperature差在哪裡? 與 機器學習是什麼?監督式、非監督式、強化學習差在哪裡? 一起複習,建立完整的AI應用規劃師知識體系,為 iPAS AI應用規劃師初級考試做好準備。

