Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

25 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ole-eval: LLM Eval 中央仓库

统一管理所有 大模型评测 (Eval) 相关的代码、结果、文档和部署配置。

注意: 本仓库只包含可公开的通用信息。个人机器名称、内网 IP、SSH 连接信息与私有路径均已移除,详见 AGENTS.md


评测项目总览

项目 状态 算力环境 模型 评测框架
SWE-bench Verified (500 实例) ✅ 完成 本地 GPU 工作站 (A100 + V100) Qwen3.6-35B-A3B-AWQ swebench harness
llama-eval Stage 1-4 ✅ 完成 AMD Strix Halo 统一内存平台 (Vulkan + V100 CUDA) 多个 GGUF 模型 自定义评测框架
DFlash 投机解码 ✅ 完成 租赁 RTX 4090 D 实例 Qwen3.6-27B + DFlash draft llama.cpp
vLLM-2080Ti Qwen3.6-27B-FP8 ✅ 完成 租赁 2× RTX 2080 Ti 实例 Qwen3.6-27B-FP8 自定义 bench
sglang Qwen3.6-35B MTP ✅ 完成 本地 GPU 工作站 Qwen3.6-35B-A3B-AWQ sglang NextN
DeepEval (LLM-as-Judge) 🟡 框架就绪 本地容器 + LiteLLM 通过 LiteLLM deepeval 4.1.4
Strix Halo NPU/GPU/CPU Embedding ✅ 完成 AMD Strix Halo 平台 Qwen3-Embedding-4B 自定义 bench

仓库结构

ole-eval/
├── README.md                          # 本文件 — 全局索引
├── AGENTS.md                          # Agent 协作规范
├── .gitignore
│
├── docs/                              # 文档
│   ├── swebench/                      # SWE-bench 评测文档
│   │   ├── final-report.md            # 最终报告
│   │   ├── eval-status.md             # 评测状态
│   │   ├── environment.md             # 环境配置
│   │   ├── eval-deployment.md         # 部署方案
│   │   ├── fix-log.md                 # 修复日志
│   │   ├── inference-results.md       # 推理结果
│   │   └── status.md                  # 阶段性状态
│   ├── benchmarks/                    # Benchmark 报告
│   │   ├── vllm2080ti_qwen36_27b_bench_20260801.md   # 2080Ti 完整报告
│   │   ├── 0801_vllm2080ti_qwen36_27b_bench.md       # 2080Ti 摘要
│   │   ├── sglang_qwen36_35b_mtp_bench_20260802.md  # sglang MTP 报告
│   │   ├── dflash_qwen36_27b_bench.md                # DFlash 完整报告
│   │   ├── 0515_dflash_qwen36_27b_eval.md            # DFlash 摘要
│   │   ├── deepeval_framework.md                      # DeepEval 说明
│   │   └── ryzenai_npu_vs_gpu_embed_bench.md       # Strix Halo Embedding 对比
│   └── analysis/                      # 综合分析
│       └── llama-eval/                # llama-eval 分析报告
│
├── code/                              # 代码
│   ├── swebench/
│   │   └── inference.py               # SWE-bench 推理脚本
│   └── llama-eval/
│       ├── eval/
│       │   ├── stage1_perf_test.py    # Stage 1 单点性能测试 (cold/warm 双指标)
│       │   ├── sweeps/                # 评测骨架 + per-model 配置
│       │   │   ├── sweeper.py         #   通用扫描框架 (context/KV/MTP 三轴)
│       │   │   └── models/            #   per-model 配置 + 定制脚本
│       │   │       └── bigbang_v1/    #     BigBang-v1 (model.json + sglang_compare.py)
│       │   └── tests/stage3_deep/     # Stage 3 深度评测 (10 类别)
│       └── README.md                  # llama-eval 项目说明
│
├── config/                            # 部署配置示例
│   ├── llama-eval/
│   │   ├── docker-compose.yml
│   │   ├── deploy.sh / deploy-podman.sh
│   │   └── update.sh
│   ├── autodl_2080ti/
│   │   └── start-qwen27b.sh           # 租赁 2080Ti 实例的 vLLM 启动脚本
│   └── deepeval/
│       ├── Dockerfile
│       └── docker-compose.yml
│
├── dashboards/                        # Dashboard 前端
│   └── llama-eval-web/                # 静态网站快照
│       ├── index.html                 # 主页
│       ├── stage1.html ~ stage3.html  # 各阶段报告
│       ├── methodology.html           # 测试规范
│       └── models/                    # 单模型报告
│
└── data/                              # 数据与结果
    ├── swebench/                      # SWE-bench 数据
    │   ├── eval_results/              # Eval JSON 结果
    │   └── predictions_full.jsonl     # 500 实例推理结果
    └── llama-eval/                    # llama-eval 数据
        ├── corpus/                    # 真实英文长文本语料 (Stage 1 性能测试用)
        └── eval_results/              # 各阶段 JSON/MD 结果

快速入门

SWE-bench

# 推理
python code/swebench/inference.py \
  --dataset swebench_verified.jsonl \
  --num_instances 0 \
  --output predictions_full.jsonl

# Eval (需要 swebench harness)
docker run --rm -v $(pwd):/swebench sweb.eval.x86_64.astropy

llama-eval

# 运行 Stage 3 评测 (需要 llama.cpp 服务)
python code/llama-eval/eval/run_stage3_all_models.py

# 启动 Dashboard
cd dashboards/llama-eval-web && python app.py

DeepEval (LLM-as-Judge)

docker exec -it deepeval bash
deepeval test run tests/test_rag_quality.py

算力环境说明(通用)

本仓库的评测在不同算力环境下完成,均以通用方式描述:

  • 本地 GPU 工作站: AMD EPYC 平台 + NVIDIA DRIVE A100 PROD 32GB + 3× Tesla V100-SXM2-16GB,用于 SWE-bench、大模型推理。
  • AMD Strix Halo 平台: AMD Ryzen AI MAX+ 395,128GB 统一内存,集成 Radeon 8060S (gfx1151) + 可选 V100,用于 Vulkan/CUDA 双后端推理与 Embedding 对比。
  • 租赁 GPU 实例: 按需租用的云端算力(如 2× RTX 2080 Ti、RTX 4090 D),用于特定模型/框架验证。

已知坑位(技术经验)

坑位 适用环境 详情
V100 CC 7.0 bfloat16 溢出 低算力 GPU 特定模型输出随机 token
V100 sglang prefill cuda graph 低算力 GPU 必须 --disable-prefill-cuda-graph
Qwen3 MTP 走 NextN 而非 frozen-kv sglang 0.5.16 frozen-kv 在 sglang 0.5.16 未实现
Tool calling parser 2× 2080Ti 部署 qwen3_xml 会在流式输出时打烂,必须用 hermes
2080Ti KV OOM 2× 2080Ti 部署 max_model_len=131072 触发 OOM,降到 65536

来源追溯

内容 原始位置
SWE-bench docs 本仓库 docs/
SWE-bench 推理脚本 本仓库 code/swebench/
llama-eval 框架 本仓库 code/llama-eval/
llama-eval 结果 本仓库 data/llama-eval/
llama-eval 前端 本仓库 dashboards/llama-eval-web/
Benchmark 报告 本仓库 docs/benchmarks/

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages