qwen-asr-serve 命令不能启动Qwen3-ForcedAligner-0.6B模型吗? #196
Unanswered
goodwin147
asked this question in
Q&A
Replies: 1 comment
|
不能直接这样启动。 两者输入也不同:
单独使用 ForcedAligner,请按 README 的 Python API: import torch
from qwen_asr import Qwen3ForcedAligner
aligner = Qwen3ForcedAligner.from_pretrained(
"Qwen/Qwen3-ForcedAligner-0.6B",
dtype=torch.bfloat16,
device_map="cuda:0",
)
result = aligner.align(
audio="audio.wav",
text="这里放已经确认的文本",
language="Chinese",
)
for item in result[0]:
print(item.text, item.start_time, item.end_time)如果需求是“上传音频 → 自动转写并返回时间戳”,应同时加载 ASR 和 aligner: from qwen_asr import Qwen3ASRModel
import torch
model = Qwen3ASRModel.from_pretrained(
"Qwen/Qwen3-ASR-1.7B", # 也可以换成 0.6B
dtype=torch.bfloat16,
device_map="cuda:0",
forced_aligner="Qwen/Qwen3-ForcedAligner-0.6B",
forced_aligner_kwargs={
"dtype": torch.bfloat16,
"device_map": "cuda:0",
},
)
result = model.transcribe(
audio="audio.wav",
language="Chinese", # 或 None 自动识别
return_time_stamps=True,
)
print(result[0].text)
print(result[0].time_stamps)需要现成 Web UI 的话,仓库已经提供组合方式: qwen-asr-demo \
--asr-checkpoint Qwen/Qwen3-ASR-1.7B \
--aligner-checkpoint Qwen/Qwen3-ForcedAligner-0.6B \
--backend transformers \
--cuda-visible-devices 0 \
--backend-kwargs '{"device_map":"cuda:0","dtype":"bfloat16","max_inference_batch_size":8,"max_new_tokens":256}' \
--aligner-kwargs '{"device_map":"cuda:0","dtype":"bfloat16"}' \
--ip 0.0.0.0 --port 8000如果一定要把 ForcedAligner 单独做成 HTTP 服务,需要自己包一层 FastAPI/Flask endpoint,接收 |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
文档里qwen-asr-serve Qwen3-ASR-1.7B \ 都是这种示例,按理说应该支持Qwen3的3钟模型都这样启动吧
All reactions