Skip to content

接入vllm启动的大模型时回复有问题 #6480

Description

@leap233

例行检查

  • 我已确认目前没有类似 issue
  • 我已完整查看过项目 README,以及项目文档
  • 我使用了自己的 key,并确认我的 key 是可正常使用的
  • 我理解并愿意跟进此 issue,协助测试和提供反馈
  • 我理解并认可上述内容,并理解项目维护者精力有限,不遵循规则的 issue 可能会被无视或直接关闭

你的版本

  • 公有云版本
  • 私有部署版本, 具体版本号: 4.14.7

问题描述, 日志截图,配置文件等
我接入了本地的大模型Qwen2.5-32B-Instruct, 它使用 VLLM 启动:
command = [
'nohup', 'python', '-m', 'vllm.entrypoints.openai.api_server',
'--model', str(path),
'--tensor-parallel-size', str(torch.cuda.device_count()),
'--port', str(port)
]

访问api为: http://xxx.xxx.xx.xx:xxxx/v1/chat/completions

我发现使用该大模型回复有问题, 只回复了非常少的内容。(可能是流式的第一个内容?) 调用截图如下:
Image

直接测试该api , 回复没有问题:
Image

我的配置:
Image

复现步骤
接入vllm启动的大模型应该可以复现, 使用了预设的 问题分类+知识库 的Agent模板。

预期结果

相关截图

Metadata

Metadata

Assignees

No one assigned

    Labels

    bugSomething isn't working

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions