Skip to content
Logo LogoEvalScope
文档 博客
⌘ K
Logo LogoEvalScope
文档 博客

🚀 快速开始

  • 简介
  • 安装
  • 快速上手
  • 可视化
  • 参数说明
  • 支持的数据集
    • LLM评测集
      • AA-LCR
      • AGIEval
      • AIME-2024
      • AIME-2025
      • AIME-2026
      • AlpacaEval2.0
      • AMC
      • AnatEM
      • ARC
      • ARC-AGI-2
      • ARC-Challenge-Indic
      • ArenaHard
      • ArXiv-Math
      • ArxivRollBench
      • ArxivRollBench-Full
      • BBH
      • BC2GM
      • BC4CHEMD
      • BC5CDR
      • BhashaBench-Multi (Ayurveda)
      • BhashaBench-Multi (Finance)
      • BhashaBench-Multi (Krishi)
      • BhashaBench-Multi (Legal)
      • BhashaBench-V1 (Ayurveda)
      • BhashaBench-V1 (Finance)
      • BhashaBench-V1 (Krishi)
      • BhashaBench-V1 (Legal)
      • BigCodeBench
      • BigCodeBench-Hard
      • BioMixQA
      • BroadTwitterCorpus
      • C-Eval
      • Chinese-SimpleQA
      • CL-bench
      • CMATH
      • C-MMLU
      • CoinFlip
      • CommonsenseQA
      • Competition-MATH
      • CoNLL2003
      • CoNLL++
      • Copious
      • CrossNER
      • Data-Collection
      • DocMath
      • DrivelologyBinaryClassification
      • DrivelologyMultilabelClassification
      • DrivelologyNarrativeSelection
      • DrivelologyNarrativeWriting
      • DROP
      • EQ-Bench
      • FinNER
      • FRAMES
      • GeneralArena
      • General-MCQ
      • General-QA
      • GeniaNER
      • GPQA-Diamond
      • GSM8K
      • GSM8K-Indic
      • HaluEval
      • HarveyNER
      • HealthBench
      • HellaSwag
      • HellaSwag-Hindi
      • Humanity's-Last-Exam
      • HMMT25
      • HMMT26
      • HMMT-Nov-2025
      • HumanEval
      • HumanEvalPlus
      • IFBench
      • IFEval
      • IMO-AnswerBench
      • BoolQ-Indic
      • IndicParam
      • IQuiz
      • JNLPBA
      • JNLPBA-Rare
      • KINA
      • Live-Code-Bench
      • LoCoMo
      • LogiQA
      • LongBench-v2
      • LongMemEval
      • MaritimeBench
      • MATH-500
      • MathQA
      • MBPP
      • MBPP-Plus
      • Med-MCQA
      • MGSM
      • MILU
      • Minerva-Math
      • MIT-Movie-Trivia
      • MIT-Restaurant
      • MMLU
      • MMLU-Pro
      • MMLU-Redux
      • MMMLU
      • MRI-MCQA
      • Multi-IF
      • MultiNERD
      • MultiPL-E HumanEval
      • MultiPL-E MBPP
      • MusicTrivia
      • MuSR
      • NCBI
      • Needle-in-a-Haystack
      • $OneMillion-Bench
      • OntoNotes5
      • OpenAI MRCR
      • PerspectiveGap Prompt Writing
      • PerspectiveGap Role Assignment
      • PIQA
      • PLawBench
      • PolyMath
      • PRBench
      • ProcessBench
      • PubMedQA
      • QASC
      • RACE
      • RefCOCO
      • Sanskriti
      • SciCode
      • SciQ
      • Seed-TTS-Eval
      • SimpleQA
      • SIQA
      • SuperGPQA
      • SWE-bench_Lite
      • SWE-bench_Verified
      • SWE-bench_Verified_mini
      • ToolBench-Static
      • TriviaQA
      • TriviaQA-Indic-MCQ
      • TruthfulQA
      • TweeBankNER
      • TweetNER7
      • Winogrande
      • WMT2024++
      • WNUT2017
      • ZebraLogicBench
    • VLM评测集
      • A-OKVQA
      • AI2D
      • AIR-Bench-Chat
      • AIR-Bench-Foundation
      • BabyVision
      • BLINK
      • CCBench
      • CC-OCR-V2
      • ChartQA
      • CharXiv
      • CMMMU
      • CMMU
      • CommonVoice15
      • CountQA
      • DocVQA
      • EmbSpatial-Bench
      • ERQA
      • FLEURS
      • General-VMCQ
      • General-VQA
      • GSM8K-V
      • HallusionBench
      • HiPhO
      • InfoVQA
      • LibriSpeech
      • LogicVista
      • Maritime-OCR-Bench
      • MathVerse
      • MathVision
      • MathVista
      • MeasureBench
      • MedXpertQA
      • MIA-Bench
      • MicroVQA
      • MMBench
      • MMStar
      • MMAU
      • MMMU
      • MMMU-PRO
      • MSR-VTT
      • MSVD
      • MVBench
      • OCRBench
      • OCRBench-v2
      • olmOCR-Bench
      • OlympiadBench
      • OmniBench
      • OmniDocBench
      • OmniDocBench-v1.6
      • PerceptionBench
      • PhyX-MC
      • PhyX-OE
      • PMC-VQA
      • POPE
      • RealWorldQA
      • Ref-Adv-s
      • ScienceQA
      • ScreenSpot-Pro
      • SEED-Bench-2-Plus
      • SimpleVQA
      • SLAKE
      • SURDS
      • THCHS-30
      • TIR-Bench
      • TORGO
      • TVBench
      • Video-MME-v2
      • VisFactor
      • VisuLogic
      • VLMs Are Biased
      • VQAv2
      • V*Bench
      • VTCBench
      • WenetSpeech
      • WorldVQA
      • ZeroBench
    • AGENT评测集
      • ACEBench
      • AutomationBench
      • BFCL-v3
      • BFCL-v4
      • BrowseComp
      • Claw-Eval
      • DeepSWE
      • DeepSearchQA
      • GAIA
      • GDPval
      • General-FunctionCalling
      • JobBench
      • K2-Vendor-Verifier
      • Kimi-Vendor-Verifier
      • MCP-Atlas
      • MiniMax-Vendor-Verifier
      • MiniWoB
      • OfficeQA
      • ResearchRubrics
      • SkillsBench
      • SWE-bench_Lite_Agentic
      • SWE-bench_Multilingual_Agentic
      • SWE-bench_Pro
      • SWE-bench_Verified_Agentic
      • SWE-bench_Verified_Mini_Agentic
      • τ²-bench
      • τ³-bench
      • τ-bench
      • Terminal-Bench-2.0
      • Terminal-Bench-2.1
      • Toolathlon Official Service Wrapper
      • WideSearch
    • AIGC评测集
      • EvalMuse
      • GEdit-Bench
      • GenAI-Bench
      • General-T2I
      • HPD-v2
      • TIFA-160
    • 其他数据集
      • OpenCompass
      • VLMEvalKit
      • MTEB 评测数据集
      • CLIP-Benchmark
  • ❓ 常见问题

🔧 教程

  • 其他评测后端
    • OpenCompass
    • VLMEvalKit
    • RAGEval
      • MTEB 文本嵌入评测
      • CLIP Benchmark
      • RAGAS RAG 评测
  • 模型推理性能压测
    • 快速开始
    • AgentX 服务性能基准
    • 参数说明
    • 使用示例
    • 多轮对话压测
    • SLA 自动调优
    • 速度基准测试
    • vLLM Bench vs Evalscope Perf 压测对比
    • 自定义使用
  • AIGC 评测
    • 文生图评测
    • 图片编辑评测
  • 竞技场模式
  • 沙箱环境使用
  • Agent 评测
    • 内置 AgentLoop 模式
    • 外部 Agent Bridge 模式
  • EvalScope 服务部署

🛠️ 进阶教程

  • 构建评测指数(Index)
    • 定义你的 Schema
    • 采样你的指数数据
    • 用你的指数统一评测
  • 自定义评测数据集
    • 大语言模型
    • 多模态大模型
    • 自定义文本检索评测数据集
    • CLIP模型
  • 自定义模型评测
  • 👍 贡献基准评测

🧰 扩展评测基准

  • 扩展评测基准
    • Terminal-Bench
    • MiniWoB
    • SkillsBench
    • Toolathlon
    • GAIA
    • WideSearch
    • DeepSearchQA
    • SWE-bench
    • SWE-bench_Pro
    • τ-bench
    • τ²-bench
    • τ³-bench
    • BFCL-v3
    • BFCL-v4
    • 大海捞针测试
    • ToolBench
    • LongBench-Write

📖 最佳实践

  • 最佳实践
    • 从对话到Agent:大模型工具调用能力的量化评测
    • 榜单不盲从:用 EvalScope 打造你的专属场景评测
    • Qwen3-Omni 模型评测最佳实践
    • Qwen3-VL 模型评测最佳实践
    • Qwen3-Next 模型评测最佳实践
    • GPT-OSS 模型评测最佳实践
    • Qwen3-Coder+Instruct 模型评测最佳实践
    • 文生图评测最佳实践
    • Qwen3 模型评测最佳实践
    • QwQ模型评测最佳实践
    • 你家的AI有多聪明?智商和情商全评测!
    • 模型思考效率评测最佳实践
    • R1类模型推理能力评测最佳实践
    • LLM全链路最佳实践
    • ms-swift 集成

🧪 基准测试结果

  • 基准测试
    • MMLU
  • 速度基准测试
    • QwQ-32B-Preview

🌟 博客

  • 欢迎阅读 EvalScope 博客!
    • RAG 评测调研:框架、指标和方法
    • OpenAI-O1
    • 打破文本边界:如何进行多模态RAG评测
EvalScope
/
支持的数据集
/
LLM评测集
/
BhashaBench-Multi (Legal)

BhashaBench-Multi (Legal)#

概述#

BhashaBench-Multi (Legal) 是一个领域特定的多项选择题基准测试,用于评估大语言模型(LLM)在22种印度语言中对印度法律知识的掌握情况。每个问题最初以英文编写,随后通过机器翻译(并附有基于LLM判断的翻译质量评分)转换为目标语言;本适配器使用的是翻译后的问题和选项。

任务描述#

  • 任务类型:领域特定的多项选择题问答

  • 输入:一道印度法律问题,包含4个选项,使用22种印度语言之一

  • 输出:正确答案对应的字母

  • 语言:阿萨姆语、孟加拉语、博多语、多格拉语、古吉拉特语、印地语、卡纳达语、克什米尔语、孔卡尼语、迈蒂利语、马拉雅拉姆语、曼尼普尔语、马拉地语、尼泊尔语、奥里亚语、旁遮普语、梵语、桑塔利语、信德语、泰米尔语、泰卢固语、乌尔都语

主要特点#

  • 每种语言约14,963道题目,覆盖22种印度语言(每个领域总计约33万题)

  • 从英文机器翻译而来,并附带基于LLM判断的翻译质量评分

  • 覆盖印度宪法规定的22种预定语言,全部使用本地文字书写;不包含英文版本

  • 提供四个独立领域的基准测试:阿育吠陀(Ayurveda)、金融(Finance)、农业(Krishi)、法律(Legal)

评估说明#

  • 默认配置采用 0-shot 评估(仅提供测试集)

  • 可通过 subset_list 参数指定评估特定语言(例如 ['Hindi', 'Tamil']),或使用 limit 限制样本数量 —— 每个领域在22种语言中每种语言约14,963道题(总计约33万题),因此完整评估所有语言将是一次大规模运行

  • 该数据集不包含英文版本

属性#

属性

值

基准测试名称

bhasha_bench_multi_legal

数据集ID

bharatgenai/BhashaBench-Multi

论文

N/A

标签

Knowledge, MCQ, MultiLingual

指标

accuracy

默认Shots数

0-shot

评估划分

test

数据统计#

指标

值

总样本数

536,030

提示词长度(平均)

490.89 字符

提示词长度(最小/最大)

225 / 6384 字符

各子集统计数据:

子集

样本数

提示词平均长度

提示词最小长度

提示词最大长度

Assamese

24,365

475.08

232

2556

Bengali

24,365

482.5

235

2066

Bodo

24,365

521.23

225

4608

Dogri

24,365

487.72

225

4432

Gujarati

24,365

463.64

232

1954

Hindi

24,365

489.37

232

2202

Kannada

24,365

475.35

232

2068

Kashmiri

24,365

514.54

242

5037

Konkani

24,365

473.95

225

4000

Maithili

24,365

473.11

225

4011

Malayalam

24,365

511.29

236

2218

Manipuri

24,365

548.36

238

6384

Marathi

24,365

487.86

232

2113

Nepali

24,365

475.87

234

2058

Oriya

24,365

458.86

232

1936

Punjabi

24,365

483.03

232

2138

Sanskrit

24,365

489.0

233

1979

Santhali

24,365

549.75

233

5074

Sindhi

24,365

455.74

234

1830

Tamil

24,365

522.97

237

2479

Telugu

24,365

481.32

234

1992

Urdu

24,365

479.13

235

2120

样例示例#

子集: Assamese

{
  "input": [
    {
      "id": "e631cc6e",
      "content": "Answer the following multiple choice question. The entire content of your response should be of the following format: 'ANSWER: [LETTER]' (without quotes) where [LETTER] is one of A,B,C,D.\n\nকোনো আদেশ প্ৰকাশ কৰাৰ পূৰ্বতে কোনো সমস্যা সংশোধন কৰাৰ বা নতুন সমস্যা উত্থাপন কৰাৰ ক্ষমতা আদালতৰ ওচৰত থাকে, আৰু এই ক্ষমতা দিয়া হয় দেৱানী প্রক্রিয়া বিধি, ১৯০৮-ৰ কোনটো ব্যৱস্থাৰ দ্বাৰা?\n\nA) অধ্যায় ১৪, বিধি ১\nB) অধ্যায় ১৪, বিধি ৫\nC) অধ্যায় XIV, বিধি ৬\nD) ধাৰা ১৫১"
    }
  ],
  "choices": [
    "অধ্যায় ১৪, বিধি ১",
    "অধ্যায় ১৪, বিধি ৫",
    "অধ্যায় XIV, বিধি ৬",
    "ধাৰা ১৫১"
  ],
  "target": "B",
  "id": 0,
  "group_id": 0,
  "metadata": {
    "language": "Assamese",
    "topic": "Procedural Law"
  }
}

提示模板#

提示模板:

Answer the following multiple choice question. The entire content of your response should be of the following format: 'ANSWER: [LETTER]' (without quotes) where [LETTER] is one of {letters}.

{question}

{choices}

使用方法#

使用命令行(CLI)#

evalscope eval \
    --model YOUR_MODEL \
    --api-url OPENAI_API_COMPAT_URL \
    --api-key EMPTY_TOKEN \
    --datasets bhasha_bench_multi_legal \
    --limit 10  # 正式评估时请删除此行

使用Python#

from evalscope import run_task
from evalscope.config import TaskConfig

task_cfg = TaskConfig(
    model='YOUR_MODEL',
    api_url='OPENAI_API_COMPAT_URL',
    api_key='EMPTY_TOKEN',
    datasets=['bhasha_bench_multi_legal'],
    dataset_args={
        'bhasha_bench_multi_legal': {
            # subset_list: ['Assamese', 'Bengali', 'Bodo']  # 可选,用于评估特定子集
        }
    },
    limit=10,  # 正式评估时请删除此行
)

run_task(task_cfg=task_cfg)
BhashaBench-Multi (Krishi)
BhashaBench-V1 (Ayurveda)

On this page

  • 概述
  • 任务描述
  • 主要特点
  • 评估说明
  • 属性
  • 数据统计
  • 样例示例
  • 提示模板
  • 使用方法
    • 使用命令行(CLI)
    • 使用Python

© 2022-2025, Alibaba ModelScope Built with Sphinx 9.1.0