此为本人的个人项目,完全由本人一个人完成。
- **训练:**cd model_train
- **网站(前后端代码完全由AI生成):**cd SQL_Dog_Web
- 性能介绍:SQL_dog对比页面
此仓库放置了多款模型,这些模型通过在Qwen3-4B-Instruct-2507上后训练而来,其主要是服务MIMIC系列数据库的Text-to-Sql任务而生的。其中SQL_Dog_DPO模型为完全由合成数据训练而来的多轮问答模型,其余模型则为单轮问答而生。具体性能如下:
| 模型名称 (Model) | Baseline (n=1) | ICL | 自一致性 | 最终执行总分 | 平均消耗 (Tokens/Q) |
|---|---|---|---|---|---|
| 4B | 41.50 | - | 47.60 (+6.10) | 47.60 | 588.37 |
| 4B Pro | 49.40 | - | 60.30 (+10.90) | 60.30 | 359.48 |
| 4B ProMax | 52.30 | - | 63.50 (+11.20) | 63.50 | 365.90 |
| 30B Coder | 51.60 | 63.90 (+12.30) | 64.40 (+0.50) | 64.40 | 643.46 |
| KIMI K25(Thinking) | - | 68.60 (Native) | - | 68.60 | 2,509.44 |
| QWEN3.5-27B(Thinking) | 52.30 | 66.90 (+14.60) | - | 66.90 | 4,098.57 |
| SQL_Dog_DPO | 52.70 | - | 61.00 (+8.30) | 61.00 | 460.91 |
- Note: 4B_Pro和4B_ProMax由EHRSQL仓库中的训练集经过两轮SFT后训练而来,SQL_Dog_DPO完全由合成数据经过两轮SFT后训练的多轮Text-to-Sql模型。
- 测试集为一个单轮对话数据集,同样来源于EHRSQL,与之不同的是删除了其中的一些模糊标注。
- 复现:要求完整参考SQL_Dog仓库
同样基于Qwen3-4B构建了一个表选择器,其仅需要消耗约10Token(n=1情况下)基于实现对应表级别高召回,具体性能分析如下:
| Method | Precision (%) | Recall (%) | Strict Recall (%) |
|---|---|---|---|
| NaiveTabSelect | 83.33 | 79.92 | 55.53 |
| Table Selector | 80.91 | 98.20 | 95.11 |
