大模型高考测评:用一套自动化流水线,来测试大模型智力
本文更新于 2026-09-15。早期版本只覆盖 6 个模型、6 个科目,如今项目已演进为 70+ 模型、7 科目的持续测评,本文改为从整体介绍项目本身:考什么、怎么考、怎么判分,不再针对某个具体模型展开。
现在的模型榜单很多,但站在中文语境下看逻辑、知识和综合能力,没有什么比高考更合适:题目公开、难度稳定、有标准答案,还自带文理分科。
我做的 llm-gaokao(大模型高考成绩榜),就是让大模型去做一整套高考卷:从抽题、答题、阅卷到榜单,全流程自动化,可重复、可追溯。在线榜单见 https://wycode.cn/gaokao。


