AI Agent· 第九讲 大型语言模型能力评估

用于评估的题目数据集

  • GSM8K

  • ARC-AGI

评分标准

Elo Score

chatbot Arena

  • beta:战力
  • Mi:第i个模型

GoodHart’s law

一个项目一旦被作为目标,就不会是一个好的结果

Ting WeChat PayWeChat Pay
0%