AI/MLツール lm-evaluation-harness on Ubuntu — LLMの性能をベンチマーク評価する方法 LLM のスコアを比較した記事や論文で「Hellaswag 75.3%」「MMLU 68.1%」といった数字を見かけることがあります。これらは lm-evaluation-harness(lm-eval) と呼ばれる評価フレームワークで計測… 2026.07.20 AI/MLツール