WebUI 使用说明

目录
  1. 启动 WebUI
    1. 命令行启动
    2. Docker 启动
  2. 界面概览
  3. 模型配置
  4. 自动化评测
    1. 评测进度监控
  5. 人工评测
    1. 评分维度
  6. 结果查看
  7. 常见问题
    1. WebUI 无法启动
    2. 评测过程中断
    3. 自定义数据集格式错误

XpertEval 提供了基于 Gradio 的 Web 用户界面,方便用户进行模型评测配置、数据集选择和结果查看。本文档详细介绍 WebUI 的使用方法。

启动 WebUI

命令行启动

# 基本启动
python app.py

# 指定端口
python app.py --port 8080

# 指定主机(允许远程访问)
python app.py --host 0.0.0.0

# 指定默认配置文件
python app.py --config models.yaml

启动后,在浏览器中访问 http://localhost:7860(或您指定的端口)即可使用 WebUI。

Docker 启动

如果您使用 Docker 部署 XpertEval,可以这样启动 WebUI:

# 运行 Docker 容器并映射端口
docker run -it --name xperteval -p 7860:7860 xperteval/xperteval:latest

# 指定配置文件
docker run -it --name xperteval -p 7860:7860 -v $(pwd)/models.yaml:/app/models.yaml xperteval/xperteval:latest --config models.yaml

界面概览

XpertEval WebUI 包含以下主要功能区域:

  1. 模型配置:配置待评测的模型 API 信息
  2. 自动化评测:选择数据集并执行自动化评测
  3. 人工评测:进行人工辅助评测
  4. 结果查看:查看和下载评测报告

模型配置

在”模型配置”标签页中,您可以:

  1. 添加模型:点击”添加模型”按钮,输入模型的 API 信息
    • API 服务地址
    • API 密钥
    • 模型名称
    • 模型类型
    • 是否为主评测 API
    • 其他参数(可选)
  2. 编辑模型:点击已添加模型卡片上的”编辑”按钮,修改模型配置

  3. 删除模型:点击已添加模型卡片上的”删除”按钮,移除模型配置

  4. 导入配置:点击”导入配置”按钮,上传 YAML 或 JSON 格式的配置文件

  5. 导出配置:点击”导出配置”按钮,将当前配置保存为 YAML 或 JSON 文件

  6. 保存配置:点击”保存配置”按钮,将当前配置保存到内存中,供评测使用

必须配置至少两个模型才能进行评测,且必须指定一个模型为主评测 API。

自动化评测

在”自动化评测”标签页中,您可以:

  1. 选择数据集
    • 从下拉菜单中选择已集成的评测数据集
    • 或点击”上传自定义数据集”按钮,上传符合 XpertFormat 规范的 JSONL 文件
  2. 选择评测指标:从列表中选择要使用的评测指标(如准确率、BLEU 分数等)

  3. 设置输出选项
    • 选择报告格式(Markdown、JSON、HTML)
    • 指定结果输出目录(可选)
  4. 启动评测:点击”开始评测”按钮,执行自动化评测

  5. 查看进度:在进度条和日志区域查看评测进度和实时日志

  6. 查看结果:评测完成后,在结果区域查看评测报告摘要

  7. 下载报告:点击”下载报告”按钮,下载完整的评测报告

评测进度监控

评测过程中,您可以实时查看:

  • 当前评测进度(已完成样本数/总样本数)
  • 预估剩余时间
  • 实时日志输出
  • 已完成样本的初步结果

如需中断评测,可以点击”停止评测”按钮。

人工评测

在”人工评测”标签页中,您可以:

  1. 选择数据集:同自动化评测,选择或上传评测数据集

  2. 开始评测:点击”开始人工评测”按钮

  3. 评分流程
    • 系统会显示当前问题及各模型的匿名答案(如”模型 A”、”模型 B”)
    • 为每个模型的答案在不同维度上打分(1-10分制)
    • 可选择添加评论
    • 点击”提交评分并继续”按钮,进入下一题
  4. 完成评测
    • 至少完成 20 道题目后,可以点击”完成评测”按钮
    • 系统会生成人工评测报告

人工评测必须完成至少 20 道题目才有效。未达到题目数量要求的评测结果不会计入最终报告。

评分维度

人工评测支持以下评分维度:

  • 准确性:回答的正确程度
  • 完整性:回答是否涵盖了问题的所有方面
  • 相关性:回答与问题的相关程度
  • 流畅性:语言表达的自然流畅程度
  • 专业性:专业知识的准确性和深度(对专业领域问题)
  • 创造性:思维的独特性和创新性(对开放性问题)

结果查看

在”结果查看”标签页中,您可以:

  1. 浏览历史报告:查看之前生成的评测报告列表

  2. 查看报告详情:点击报告列表中的条目,查看完整报告内容

  3. 可视化比较:查看不同模型在各评测指标上的对比图表

  4. 下载报告:下载选定的评测报告(支持 Markdown、JSON、HTML 格式)

  5. 删除报告:删除不再需要的历史报告

常见问题

WebUI 无法启动

可能的原因和解决方法:

  1. 端口冲突:尝试使用不同端口
    python app.py --port 8080
    
  2. 依赖问题:确保安装了所有依赖
    pip install -r requirements.txt
    
  3. 权限问题:检查文件和目录权限

评测过程中断

如果评测过程意外中断,您可以:

  1. 检查日志文件(logs/xperteval.log)了解中断原因
  2. 调整配置参数(如增加超时时间)
  3. 使用较小的数据集或启用批处理模式重新尝试

自定义数据集格式错误

如果上传的自定义数据集格式有误,系统会显示错误信息。请确保:

  1. 数据集为 JSONL 格式(每行一个 JSON 对象)
  2. 每个样本包含必需字段(idqueryresponse
  3. 符合 XpertFormat 规范

可以使用验证工具检查数据集格式:

python scripts/convert_dataset.py validate --input path/to/dataset.jsonl