AI Agent· 第九讲 大型语言模型能力评估 Ting included in 课程 李宏毅20262026-07-02 About 100 words One minute Contents 用于评估的题目数据集 评分标准 Elo Score 用于评估的题目数据集 GSM8K ARC-AGI 评分标准 Elo Score chatbot Arena beta:战力 Mi:第i个模型 GoodHart’s law 一个项目一旦被作为目标,就不会是一个好的结果 为博主买一杯java WeChat Pay