Skip to content

Aki-R/vllm_sample

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 

Repository files navigation

vLLM Qwen Sample

このプロジェクトは、vLLMライブラリを使用してQwen2.5-1.5B-Instruct-AWQモデルを高速に推論するサンプルコードです。モデルの初期化時間と推論時間を測定し、ベンチマーク情報を表示します。

環境要件

  • OS: WSL (Windows Subsystem for Linux)
  • Python: 3.11 (conda環境推奨)
  • GPU: NVIDIA GeForce RTX 3050 (CUDA 13.2対応)
  • CUDA: 13.2
  • メモリ: 最低6GB GPUメモリ推奨

インストール

  1. conda環境を作成し、Python 3.11をインストールします:
conda create -n vllm_env python=3.11
conda activate vllm_env
  1. 必要なパッケージをインストールします:
pip install -r requirements.txt

使用方法

  1. conda環境をアクティブ化します:
conda activate vllm_env
  1. qwen_sample.py を実行します:
python qwen_sample.py

このスクリプトは以下の処理を行います:

  • Qwen2.5-1.5B-Instruct-AWQモデルのロード
  • サンプルプロンプトに対する推論実行
  • 初期化時間と推論時間の測定
  • トークン数とスループットの表示

実行例

===== OUTPUT =====
以下は、Pythonで1から10までを足すコードです:

```python
total = 0
for i in range(1, 11):
    total += i
print(total)

===== BENCHMARK SUMMARY ===== Init time : 35.257 sec Total time : 17.023 sec Input tokens : 13 Output tokens : 248 Total tokens : 261 Throughput : 14.57 tok/sec


## 注意事項

- GPUメモリ使用率を0.5に設定しているため、GPUメモリが不足する場合は調整してください
- モデルはHugging Faceから自動ダウンロードされます
- 初回実行時はモデルのダウンロードに時間がかかります

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages