Skip to content
Logo LogoEvalScope
文档 博客
⌘ K
Logo LogoEvalScope
文档 博客

🚀 快速开始

  • 简介
  • 安装
  • 快速上手
  • 可视化
  • 参数说明
  • 支持的数据集
    • LLM评测集
      • AA-LCR
      • AGIEval
      • AIME-2024
      • AIME-2025
      • AIME-2026
      • AlpacaEval2.0
      • AMC
      • AnatEM
      • ARC
      • ARC-AGI-2
      • ARC-Challenge-Indic
      • ArenaHard
      • ArXiv-Math
      • ArxivRollBench
      • ArxivRollBench-Full
      • BBH
      • BC2GM
      • BC4CHEMD
      • BC5CDR
      • BhashaBench-Multi (Ayurveda)
      • BhashaBench-Multi (Finance)
      • BhashaBench-Multi (Krishi)
      • BhashaBench-Multi (Legal)
      • BhashaBench-V1 (Ayurveda)
      • BhashaBench-V1 (Finance)
      • BhashaBench-V1 (Krishi)
      • BhashaBench-V1 (Legal)
      • BigCodeBench
      • BigCodeBench-Hard
      • BioMixQA
      • BroadTwitterCorpus
      • C-Eval
      • Chinese-SimpleQA
      • CL-bench
      • CMATH
      • C-MMLU
      • CoinFlip
      • CommonsenseQA
      • Competition-MATH
      • CoNLL2003
      • CoNLL++
      • Copious
      • CrossNER
      • Data-Collection
      • DocMath
      • DrivelologyBinaryClassification
      • DrivelologyMultilabelClassification
      • DrivelologyNarrativeSelection
      • DrivelologyNarrativeWriting
      • DROP
      • EQ-Bench
      • FinNER
      • FRAMES
      • GeneralArena
      • General-MCQ
      • General-QA
      • GeniaNER
      • GPQA-Diamond
      • GSM8K
      • GSM8K-Indic
      • HaluEval
      • HarveyNER
      • HealthBench
      • HellaSwag
      • HellaSwag-Hindi
      • Humanity's-Last-Exam
      • HMMT25
      • HMMT26
      • HMMT-Nov-2025
      • HumanEval
      • HumanEvalPlus
      • IFBench
      • IFEval
      • IMO-AnswerBench
      • BoolQ-Indic
      • IndicParam
      • IQuiz
      • JNLPBA
      • JNLPBA-Rare
      • KINA
      • Live-Code-Bench
      • LoCoMo
      • LogiQA
      • LongBench-v2
      • LongMemEval
      • MaritimeBench
      • MATH-500
      • MathQA
      • MBPP
      • MBPP-Plus
      • Med-MCQA
      • MGSM
      • MILU
      • Minerva-Math
      • MIT-Movie-Trivia
      • MIT-Restaurant
      • MMLU
      • MMLU-Pro
      • MMLU-Redux
      • MMMLU
      • MRI-MCQA
      • Multi-IF
      • MultiNERD
      • MultiPL-E HumanEval
      • MultiPL-E MBPP
      • MusicTrivia
      • MuSR
      • NCBI
      • Needle-in-a-Haystack
      • $OneMillion-Bench
      • OntoNotes5
      • OpenAI MRCR
      • PerspectiveGap Prompt Writing
      • PerspectiveGap Role Assignment
      • PIQA
      • PLawBench
      • PolyMath
      • PRBench
      • ProcessBench
      • PubMedQA
      • QASC
      • RACE
      • RefCOCO
      • Sanskriti
      • SciCode
      • SciQ
      • Seed-TTS-Eval
      • SimpleQA
      • SIQA
      • SuperGPQA
      • SWE-bench_Lite
      • SWE-bench_Verified
      • SWE-bench_Verified_mini
      • ToolBench-Static
      • TriviaQA
      • TriviaQA-Indic-MCQ
      • TruthfulQA
      • TweeBankNER
      • TweetNER7
      • Winogrande
      • WMT2024++
      • WNUT2017
      • ZebraLogicBench
    • VLM评测集
      • A-OKVQA
      • AI2D
      • AIR-Bench-Chat
      • AIR-Bench-Foundation
      • BabyVision
      • BLINK
      • CCBench
      • CC-OCR-V2
      • ChartQA
      • CharXiv
      • CMMMU
      • CMMU
      • CommonVoice15
      • CountQA
      • DocVQA
      • EmbSpatial-Bench
      • ERQA
      • FLEURS
      • General-VMCQ
      • General-VQA
      • GSM8K-V
      • HallusionBench
      • HiPhO
      • InfoVQA
      • LibriSpeech
      • LogicVista
      • Maritime-OCR-Bench
      • MathVerse
      • MathVision
      • MathVista
      • MeasureBench
      • MedXpertQA
      • MIA-Bench
      • MicroVQA
      • MMBench
      • MMStar
      • MMAU
      • MMMU
      • MMMU-PRO
      • MSR-VTT
      • MSVD
      • MVBench
      • OCRBench
      • OCRBench-v2
      • olmOCR-Bench
      • OlympiadBench
      • OmniBench
      • OmniDocBench
      • OmniDocBench-v1.6
      • PerceptionBench
      • PhyX-MC
      • PhyX-OE
      • PMC-VQA
      • POPE
      • RealWorldQA
      • Ref-Adv-s
      • ScienceQA
      • ScreenSpot-Pro
      • SEED-Bench-2-Plus
      • SimpleVQA
      • SLAKE
      • SURDS
      • THCHS-30
      • TIR-Bench
      • TORGO
      • TVBench
      • Video-MME-v2
      • VisFactor
      • VisuLogic
      • VLMs Are Biased
      • VQAv2
      • V*Bench
      • VTCBench
      • WenetSpeech
      • WorldVQA
      • ZeroBench
    • AGENT评测集
      • ACEBench
      • AutomationBench
      • BFCL-v3
      • BFCL-v4
      • BrowseComp
      • Claw-Eval
      • DeepSWE
      • DeepSearchQA
      • GAIA
      • GDPval
      • General-FunctionCalling
      • JobBench
      • K2-Vendor-Verifier
      • Kimi-Vendor-Verifier
      • MCP-Atlas
      • MiniMax-Vendor-Verifier
      • MiniWoB
      • OfficeQA
      • ResearchRubrics
      • SkillsBench
      • SWE-bench_Lite_Agentic
      • SWE-bench_Multilingual_Agentic
      • SWE-bench_Pro
      • SWE-bench_Verified_Agentic
      • SWE-bench_Verified_Mini_Agentic
      • τ²-bench
      • τ³-bench
      • τ-bench
      • Terminal-Bench-2.0
      • Terminal-Bench-2.1
      • Toolathlon Official Service Wrapper
      • WideSearch
    • AIGC评测集
      • EvalMuse
      • GEdit-Bench
      • GenAI-Bench
      • General-T2I
      • HPD-v2
      • TIFA-160
    • 其他数据集
      • OpenCompass
      • VLMEvalKit
      • MTEB 评测数据集
      • CLIP-Benchmark
  • ❓ 常见问题

🔧 教程

  • 其他评测后端
    • OpenCompass
    • VLMEvalKit
    • RAGEval
      • MTEB 文本嵌入评测
      • CLIP Benchmark
      • RAGAS RAG 评测
  • 模型推理性能压测
    • 快速开始
    • AgentX 服务性能基准
    • 参数说明
    • 使用示例
    • 多轮对话压测
    • SLA 自动调优
    • 速度基准测试
    • vLLM Bench vs Evalscope Perf 压测对比
    • 自定义使用
  • AIGC 评测
    • 文生图评测
    • 图片编辑评测
  • 竞技场模式
  • 沙箱环境使用
  • Agent 评测
    • 内置 AgentLoop 模式
    • 外部 Agent Bridge 模式
  • EvalScope 服务部署

🛠️ 进阶教程

  • 构建评测指数(Index)
    • 定义你的 Schema
    • 采样你的指数数据
    • 用你的指数统一评测
  • 自定义评测数据集
    • 大语言模型
    • 多模态大模型
    • 自定义文本检索评测数据集
    • CLIP模型
  • 自定义模型评测
  • 👍 贡献基准评测

🧰 扩展评测基准

  • 扩展评测基准
    • Terminal-Bench
    • MiniWoB
    • SkillsBench
    • Toolathlon
    • GAIA
    • WideSearch
    • DeepSearchQA
    • SWE-bench
    • SWE-bench_Pro
    • τ-bench
    • τ²-bench
    • τ³-bench
    • BFCL-v3
    • BFCL-v4
    • 大海捞针测试
    • ToolBench
    • LongBench-Write

📖 最佳实践

  • 最佳实践
    • 从对话到Agent:大模型工具调用能力的量化评测
    • 榜单不盲从:用 EvalScope 打造你的专属场景评测
    • Qwen3-Omni 模型评测最佳实践
    • Qwen3-VL 模型评测最佳实践
    • Qwen3-Next 模型评测最佳实践
    • GPT-OSS 模型评测最佳实践
    • Qwen3-Coder+Instruct 模型评测最佳实践
    • 文生图评测最佳实践
    • Qwen3 模型评测最佳实践
    • QwQ模型评测最佳实践
    • 你家的AI有多聪明?智商和情商全评测!
    • 模型思考效率评测最佳实践
    • R1类模型推理能力评测最佳实践
    • LLM全链路最佳实践
    • ms-swift 集成

🧪 基准测试结果

  • 基准测试
    • MMLU
  • 速度基准测试
    • QwQ-32B-Preview

🌟 博客

  • 欢迎阅读 EvalScope 博客!
    • RAG 评测调研:框架、指标和方法
    • OpenAI-O1
    • 打破文本边界:如何进行多模态RAG评测
EvalScope
/
支持的数据集
/
LLM评测集
/
BhashaBench-V1 (Legal)

BhashaBench-V1 (Legal)#

概述#

BhashaBench-Legal 是 BhashaBench-Multi 法律领域的前身:这是一个领域特定的多项选择题基准测试,用于评估大语言模型对印度法律的知识,涵盖英语和印地语。

任务描述#

  • 任务类型:领域特定的多项选择题问答

  • 输入:一道包含4个选项的印度法律问题,语言为英语或印地语

  • 输出:正确答案的字母

  • 语言:英语、印地语

主要特点#

  • 每种语言包含5,600至17,000道题目,仅涵盖英语和印地语

  • 作为 BhashaBench-Multi 的前身:领域相同,但语言覆盖范围更窄

  • 每个领域对应一个独立的代码仓库,英语和印地语分别作为独立的配置项

评估说明#

  • 默认配置使用 0-shot 评估(仅提供 test 分割)

  • 使用 subset_list 可评估单一语言(例如 ['Hindi'])

  • 需要访问此受限制的数据集——在 ModelScope(默认 Hub)上,请先接受条款并确保已登录;或者将 dataset_hub 设置为 huggingface,并在 huggingface.co 上接受条款后使用 HF_TOKEN

  • 如需同一领域但更广泛的语言覆盖,请参见 bhasha_bench_multi_legal(涵盖22种印度语言,无需授权)

属性#

属性

值

基准测试名称

bhashabenchv1_legal

数据集ID

bharatgenai/BhashaBench-Legal

论文

无

标签

Knowledge, MCQ, MultiLingual

指标

accuracy

默认示例数

0-shot

评估分割

test

数据统计#

指标

值

总样本数

24,365

提示词长度(平均)

513.88 字符

提示词长度(最小/最大)

229 / 4628 字符

各子集统计数据:

子集

样本数

提示词平均长度

提示词最小长度

提示词最大长度

English

17,047

539.36

233

4628

Hindi

7,318

454.52

229

1748

样例示例#

子集: English

{
  "input": [
    {
      "id": "6e1ae42b",
      "content": "Answer the following multiple choice question. The entire content of your response should be of the following format: 'ANSWER: [LETTER]' (without quotes) where [LETTER] is one of A,B,C,D.\n\nPower to amend the issue or frame additional issues prior to passing of a decree vests in a Court by virtue of which provision of the Code of Civil Procedure, 1908?\n\nA) Order XIV Rule 1\nB) Order XIV Rule 5\nC) Order XIV Rule 6\nD) Section 151"
    }
  ],
  "choices": [
    "Order XIV Rule 1",
    "Order XIV Rule 5",
    "Order XIV Rule 6",
    "Section 151"
  ],
  "target": "B",
  "id": 0,
  "group_id": 0,
  "metadata": {
    "language": "English",
    "topic": "Procedural Law"
  }
}

提示模板#

提示模板:

Answer the following multiple choice question. The entire content of your response should be of the following format: 'ANSWER: [LETTER]' (without quotes) where [LETTER] is one of {letters}.

{question}

{choices}

使用方法#

使用 CLI#

evalscope eval \
    --model YOUR_MODEL \
    --api-url OPENAI_API_COMPAT_URL \
    --api-key EMPTY_TOKEN \
    --datasets bhashabenchv1_legal \
    --limit 10  # 正式评估时请删除此行

使用 Python#

from evalscope import run_task
from evalscope.config import TaskConfig

task_cfg = TaskConfig(
    model='YOUR_MODEL',
    api_url='OPENAI_API_COMPAT_URL',
    api_key='EMPTY_TOKEN',
    datasets=['bhashabenchv1_legal'],
    dataset_args={
        'bhashabenchv1_legal': {
            # subset_list: ['English', 'Hindi']  # 可选,用于评估特定子集
        }
    },
    limit=10,  # 正式评估时请删除此行
)

run_task(task_cfg=task_cfg)
BhashaBench-V1 (Krishi)
BigCodeBench

On this page

  • 概述
  • 任务描述
  • 主要特点
  • 评估说明
  • 属性
  • 数据统计
  • 样例示例
  • 提示模板
  • 使用方法
    • 使用 CLI
    • 使用 Python

© 2022-2025, Alibaba ModelScope Built with Sphinx 9.1.0