统一管理所有 大模型评测 (Eval) 相关的代码、结果、文档和部署配置。
注意: 本仓库只包含可公开的通用信息。个人机器名称、内网 IP、SSH 连接信息与私有路径均已移除,详见 AGENTS.md。
| 项目 | 状态 | 算力环境 | 模型 | 评测框架 |
|---|---|---|---|---|
| SWE-bench Verified (500 实例) | ✅ 完成 | 本地 GPU 工作站 (A100 + V100) | Qwen3.6-35B-A3B-AWQ | swebench harness |
| llama-eval Stage 1-4 | ✅ 完成 | AMD Strix Halo 统一内存平台 (Vulkan + V100 CUDA) | 多个 GGUF 模型 | 自定义评测框架 |
| DFlash 投机解码 | ✅ 完成 | 租赁 RTX 4090 D 实例 | Qwen3.6-27B + DFlash draft | llama.cpp |
| vLLM-2080Ti Qwen3.6-27B-FP8 | ✅ 完成 | 租赁 2× RTX 2080 Ti 实例 | Qwen3.6-27B-FP8 | 自定义 bench |
| sglang Qwen3.6-35B MTP | ✅ 完成 | 本地 GPU 工作站 | Qwen3.6-35B-A3B-AWQ | sglang NextN |
| DeepEval (LLM-as-Judge) | 🟡 框架就绪 | 本地容器 + LiteLLM | 通过 LiteLLM | deepeval 4.1.4 |
| Strix Halo NPU/GPU/CPU Embedding | ✅ 完成 | AMD Strix Halo 平台 | Qwen3-Embedding-4B | 自定义 bench |
ole-eval/
├── README.md # 本文件 — 全局索引
├── AGENTS.md # Agent 协作规范
├── .gitignore
│
├── docs/ # 文档
│ ├── swebench/ # SWE-bench 评测文档
│ │ ├── final-report.md # 最终报告
│ │ ├── eval-status.md # 评测状态
│ │ ├── environment.md # 环境配置
│ │ ├── eval-deployment.md # 部署方案
│ │ ├── fix-log.md # 修复日志
│ │ ├── inference-results.md # 推理结果
│ │ └── status.md # 阶段性状态
│ ├── benchmarks/ # Benchmark 报告
│ │ ├── vllm2080ti_qwen36_27b_bench_20260801.md # 2080Ti 完整报告
│ │ ├── 0801_vllm2080ti_qwen36_27b_bench.md # 2080Ti 摘要
│ │ ├── sglang_qwen36_35b_mtp_bench_20260802.md # sglang MTP 报告
│ │ ├── dflash_qwen36_27b_bench.md # DFlash 完整报告
│ │ ├── 0515_dflash_qwen36_27b_eval.md # DFlash 摘要
│ │ ├── deepeval_framework.md # DeepEval 说明
│ │ └── ryzenai_npu_vs_gpu_embed_bench.md # Strix Halo Embedding 对比
│ └── analysis/ # 综合分析
│ └── llama-eval/ # llama-eval 分析报告
│
├── code/ # 代码
│ ├── swebench/
│ │ └── inference.py # SWE-bench 推理脚本
│ └── llama-eval/
│ ├── eval/
│ │ ├── stage1_perf_test.py # Stage 1 单点性能测试 (cold/warm 双指标)
│ │ ├── sweeps/ # 评测骨架 + per-model 配置
│ │ │ ├── sweeper.py # 通用扫描框架 (context/KV/MTP 三轴)
│ │ │ └── models/ # per-model 配置 + 定制脚本
│ │ │ └── bigbang_v1/ # BigBang-v1 (model.json + sglang_compare.py)
│ │ └── tests/stage3_deep/ # Stage 3 深度评测 (10 类别)
│ └── README.md # llama-eval 项目说明
│
├── config/ # 部署配置示例
│ ├── llama-eval/
│ │ ├── docker-compose.yml
│ │ ├── deploy.sh / deploy-podman.sh
│ │ └── update.sh
│ ├── autodl_2080ti/
│ │ └── start-qwen27b.sh # 租赁 2080Ti 实例的 vLLM 启动脚本
│ └── deepeval/
│ ├── Dockerfile
│ └── docker-compose.yml
│
├── dashboards/ # Dashboard 前端
│ └── llama-eval-web/ # 静态网站快照
│ ├── index.html # 主页
│ ├── stage1.html ~ stage3.html # 各阶段报告
│ ├── methodology.html # 测试规范
│ └── models/ # 单模型报告
│
└── data/ # 数据与结果
├── swebench/ # SWE-bench 数据
│ ├── eval_results/ # Eval JSON 结果
│ └── predictions_full.jsonl # 500 实例推理结果
└── llama-eval/ # llama-eval 数据
├── corpus/ # 真实英文长文本语料 (Stage 1 性能测试用)
└── eval_results/ # 各阶段 JSON/MD 结果
# 推理
python code/swebench/inference.py \
--dataset swebench_verified.jsonl \
--num_instances 0 \
--output predictions_full.jsonl
# Eval (需要 swebench harness)
docker run --rm -v $(pwd):/swebench sweb.eval.x86_64.astropy# 运行 Stage 3 评测 (需要 llama.cpp 服务)
python code/llama-eval/eval/run_stage3_all_models.py
# 启动 Dashboard
cd dashboards/llama-eval-web && python app.pydocker exec -it deepeval bash
deepeval test run tests/test_rag_quality.py本仓库的评测在不同算力环境下完成,均以通用方式描述:
- 本地 GPU 工作站: AMD EPYC 平台 + NVIDIA DRIVE A100 PROD 32GB + 3× Tesla V100-SXM2-16GB,用于 SWE-bench、大模型推理。
- AMD Strix Halo 平台: AMD Ryzen AI MAX+ 395,128GB 统一内存,集成 Radeon 8060S (gfx1151) + 可选 V100,用于 Vulkan/CUDA 双后端推理与 Embedding 对比。
- 租赁 GPU 实例: 按需租用的云端算力(如 2× RTX 2080 Ti、RTX 4090 D),用于特定模型/框架验证。
| 坑位 | 适用环境 | 详情 |
|---|---|---|
| V100 CC 7.0 bfloat16 溢出 | 低算力 GPU | 特定模型输出随机 token |
| V100 sglang prefill cuda graph | 低算力 GPU | 必须 --disable-prefill-cuda-graph |
| Qwen3 MTP 走 NextN 而非 frozen-kv | sglang 0.5.16 | frozen-kv 在 sglang 0.5.16 未实现 |
| Tool calling parser | 2× 2080Ti 部署 | qwen3_xml 会在流式输出时打烂,必须用 hermes |
| 2080Ti KV OOM | 2× 2080Ti 部署 | max_model_len=131072 触发 OOM,降到 65536 |
| 内容 | 原始位置 |
|---|---|
| SWE-bench docs | 本仓库 docs/ |
| SWE-bench 推理脚本 | 本仓库 code/swebench/ |
| llama-eval 框架 | 本仓库 code/llama-eval/ |
| llama-eval 结果 | 本仓库 data/llama-eval/ |
| llama-eval 前端 | 本仓库 dashboards/llama-eval-web/ |
| Benchmark 报告 | 本仓库 docs/benchmarks/ |