WebUI 使用说明
XpertEval 提供了基于 Gradio 的 Web 用户界面,方便用户进行模型评测配置、数据集选择和结果查看。本文档详细介绍 WebUI 的使用方法。
启动 WebUI
命令行启动
# 基本启动
python app.py
# 指定端口
python app.py --port 8080
# 指定主机(允许远程访问)
python app.py --host 0.0.0.0
# 指定默认配置文件
python app.py --config models.yaml
启动后,在浏览器中访问 http://localhost:7860(或您指定的端口)即可使用 WebUI。
Docker 启动
如果您使用 Docker 部署 XpertEval,可以这样启动 WebUI:
# 运行 Docker 容器并映射端口
docker run -it --name xperteval -p 7860:7860 xperteval/xperteval:latest
# 指定配置文件
docker run -it --name xperteval -p 7860:7860 -v $(pwd)/models.yaml:/app/models.yaml xperteval/xperteval:latest --config models.yaml
界面概览
XpertEval WebUI 包含以下主要功能区域:
- 模型配置:配置待评测的模型 API 信息
- 自动化评测:选择数据集并执行自动化评测
- 人工评测:进行人工辅助评测
- 结果查看:查看和下载评测报告
模型配置
在”模型配置”标签页中,您可以:
- 添加模型:点击”添加模型”按钮,输入模型的 API 信息
- API 服务地址
- API 密钥
- 模型名称
- 模型类型
- 是否为主评测 API
- 其他参数(可选)
-
编辑模型:点击已添加模型卡片上的”编辑”按钮,修改模型配置
-
删除模型:点击已添加模型卡片上的”删除”按钮,移除模型配置
-
导入配置:点击”导入配置”按钮,上传 YAML 或 JSON 格式的配置文件
-
导出配置:点击”导出配置”按钮,将当前配置保存为 YAML 或 JSON 文件
- 保存配置:点击”保存配置”按钮,将当前配置保存到内存中,供评测使用
必须配置至少两个模型才能进行评测,且必须指定一个模型为主评测 API。
自动化评测
在”自动化评测”标签页中,您可以:
- 选择数据集:
- 从下拉菜单中选择已集成的评测数据集
- 或点击”上传自定义数据集”按钮,上传符合 XpertFormat 规范的 JSONL 文件
-
选择评测指标:从列表中选择要使用的评测指标(如准确率、BLEU 分数等)
- 设置输出选项:
- 选择报告格式(Markdown、JSON、HTML)
- 指定结果输出目录(可选)
-
启动评测:点击”开始评测”按钮,执行自动化评测
-
查看进度:在进度条和日志区域查看评测进度和实时日志
-
查看结果:评测完成后,在结果区域查看评测报告摘要
- 下载报告:点击”下载报告”按钮,下载完整的评测报告
评测进度监控
评测过程中,您可以实时查看:
- 当前评测进度(已完成样本数/总样本数)
- 预估剩余时间
- 实时日志输出
- 已完成样本的初步结果
如需中断评测,可以点击”停止评测”按钮。
人工评测
在”人工评测”标签页中,您可以:
-
选择数据集:同自动化评测,选择或上传评测数据集
-
开始评测:点击”开始人工评测”按钮
- 评分流程:
- 系统会显示当前问题及各模型的匿名答案(如”模型 A”、”模型 B”)
- 为每个模型的答案在不同维度上打分(1-10分制)
- 可选择添加评论
- 点击”提交评分并继续”按钮,进入下一题
- 完成评测:
- 至少完成 20 道题目后,可以点击”完成评测”按钮
- 系统会生成人工评测报告
人工评测必须完成至少 20 道题目才有效。未达到题目数量要求的评测结果不会计入最终报告。
评分维度
人工评测支持以下评分维度:
- 准确性:回答的正确程度
- 完整性:回答是否涵盖了问题的所有方面
- 相关性:回答与问题的相关程度
- 流畅性:语言表达的自然流畅程度
- 专业性:专业知识的准确性和深度(对专业领域问题)
- 创造性:思维的独特性和创新性(对开放性问题)
结果查看
在”结果查看”标签页中,您可以:
-
浏览历史报告:查看之前生成的评测报告列表
-
查看报告详情:点击报告列表中的条目,查看完整报告内容
-
可视化比较:查看不同模型在各评测指标上的对比图表
-
下载报告:下载选定的评测报告(支持 Markdown、JSON、HTML 格式)
-
删除报告:删除不再需要的历史报告
常见问题
WebUI 无法启动
可能的原因和解决方法:
- 端口冲突:尝试使用不同端口
python app.py --port 8080 - 依赖问题:确保安装了所有依赖
pip install -r requirements.txt - 权限问题:检查文件和目录权限
评测过程中断
如果评测过程意外中断,您可以:
- 检查日志文件(
logs/xperteval.log)了解中断原因 - 调整配置参数(如增加超时时间)
- 使用较小的数据集或启用批处理模式重新尝试
自定义数据集格式错误
如果上传的自定义数据集格式有误,系统会显示错误信息。请确保:
- 数据集为 JSONL 格式(每行一个 JSON 对象)
- 每个样本包含必需字段(
id、query、response) - 符合 XpertFormat 规范
可以使用验证工具检查数据集格式:
python scripts/convert_dataset.py validate --input path/to/dataset.jsonl