📚 Documentation
对 vllm_guide_zh_v2.md 这份文档的一点补充修改意见。
其实这个问题我在 #3203 最后提了,但是没有回应,我当时也觉得不是什么太重要的问题就没再跟进。
最近因为需要处理vllm的代码居然又碰到一次,所以我把它提出来,我们再判断一下是否需要在 vllm_guide_zh_v2.md 里简单提下: 要下载 Fun-ASR-Nano-2512 的权重,我们当然习惯从魔塔社区下载,但是应该有不少人习惯去 huggingface 下载,这就可能引发我要说的下面一系列问题。
如果 google “Fun-ASR-Nano-2512 vllm" 这两个关键词(我最早不熟悉 funasr就是这么做的), 这半年以来一直都是这个排名 ,就是排名第一是 allendou/Fun-ASR-Nano-2512-vllm
我一开始也是从 huggingface 下载这个权重,以为它就是 Fun-ASR-Nano-2512 权重。 所以这里引申一个问题 , Fun-ASR-Nano-2512 官方在huggingface 没有权重文件 ,https://huggingface.co/FunAudioLLM/Fun-ASR-Nano-2512/tree/main/Qwen3-0.6B , 权重文件只在魔塔社区有 https://modelscope.cn/models/FunAudioLLM/Fun-ASR-Nano-2512/ ,而且我们代码里还需要通过 prepare_vllm_model_dir() 转成vllm能使用格式文件才能真的让vllm 用上 (这已经是一个坑!如果对vllm机制不了解,光光我描述这个过程可能就很容易晕了)
然后我进一步查 vllm官方文档, 在这里 https://docs.vllm.ai/en/latest/models/supported_models/#transcription 写了是 allendou/Fun-ASR-Nano-2512-vllm 所以我一开始一直以为要用vllm加载Fun-ASR-Nano-2512 权重就是这个了
直到我对funasr有了一定了解,并测试它的识别结果才发现问题。 而最近因为工作关系需要读vllm代码,才注意 有这个文件 https://github.com/vllm-project/vllm/blob/main/vllm/model_executor/models/funasr.py 而且它的作者就是 allendou , 读了代码也才明白要怎么使用 allendou/Fun-ASR-Nano-2512-vllm 才正确。
附带说一下 使用vllm 最终需要调用到 vllm/model_executor/models/registry.py ,根据 HF transformers 的约定,{模型家族}For{任务} , Fun-ASR-Nano 的名字是 Qwen3ForCausalLM 虽然也没错,但是总感觉太泛,反而 allendou/Fun-ASR-Nano-2512-vllm 使用的 FunASRForConditionalGeneration 描述”更贴切“,好懂一点 (当然这个扯远了)
说了这么多,不知道说明白我的问题没有,我的建议就是考虑在 vllm_guide_zh_v2.md 这份文档的一点补充 如果”正确下载、使用“ 官方 Fun-ASR-Nano 权重文件
📚 Documentation
对 vllm_guide_zh_v2.md 这份文档的一点补充修改意见。
其实这个问题我在 #3203 最后提了,但是没有回应,我当时也觉得不是什么太重要的问题就没再跟进。
最近因为需要处理vllm的代码居然又碰到一次,所以我把它提出来,我们再判断一下是否需要在 vllm_guide_zh_v2.md 里简单提下: 要下载 Fun-ASR-Nano-2512 的权重,我们当然习惯从魔塔社区下载,但是应该有不少人习惯去 huggingface 下载,这就可能引发我要说的下面一系列问题。
如果 google “Fun-ASR-Nano-2512 vllm" 这两个关键词(我最早不熟悉 funasr就是这么做的), 这半年以来一直都是这个排名 ,就是排名第一是
allendou/Fun-ASR-Nano-2512-vllm我一开始也是从 huggingface 下载这个权重,以为它就是 Fun-ASR-Nano-2512 权重。 所以这里引申一个问题 , Fun-ASR-Nano-2512 官方在huggingface 没有权重文件 ,https://huggingface.co/FunAudioLLM/Fun-ASR-Nano-2512/tree/main/Qwen3-0.6B , 权重文件只在魔塔社区有 https://modelscope.cn/models/FunAudioLLM/Fun-ASR-Nano-2512/ ,而且我们代码里还需要通过
prepare_vllm_model_dir()转成vllm能使用格式文件才能真的让vllm 用上 (这已经是一个坑!如果对vllm机制不了解,光光我描述这个过程可能就很容易晕了)然后我进一步查 vllm官方文档, 在这里 https://docs.vllm.ai/en/latest/models/supported_models/#transcription 写了是
allendou/Fun-ASR-Nano-2512-vllm所以我一开始一直以为要用vllm加载Fun-ASR-Nano-2512 权重就是这个了直到我对funasr有了一定了解,并测试它的识别结果才发现问题。 而最近因为工作关系需要读vllm代码,才注意 有这个文件 https://github.com/vllm-project/vllm/blob/main/vllm/model_executor/models/funasr.py 而且它的作者就是 allendou , 读了代码也才明白要怎么使用
allendou/Fun-ASR-Nano-2512-vllm才正确。附带说一下 使用vllm 最终需要调用到 vllm/model_executor/models/registry.py ,根据 HF transformers 的约定,
{模型家族}For{任务}, Fun-ASR-Nano 的名字是Qwen3ForCausalLM虽然也没错,但是总感觉太泛,反而allendou/Fun-ASR-Nano-2512-vllm使用的FunASRForConditionalGeneration描述”更贴切“,好懂一点 (当然这个扯远了)说了这么多,不知道说明白我的问题没有,我的建议就是考虑在 vllm_guide_zh_v2.md 这份文档的一点补充 如果”正确下载、使用“ 官方 Fun-ASR-Nano 权重文件