docker build -t bert-onnx-service .
docker run --rm -p 8000:8000 --name bert-onnx \
-v $(pwd)/models:/app/models:ro \
bert-onnx-service
curl http://localhost:8000/health
curl -X POST http://localhost:8000/predict \
-H "Content-Type: application/json" \
-d '{"text":"您好,我想请问一下那个"}'
sudo docker save -o bert-onnx-service.tar bert-onnx-service:latest
sudo docker load -i bert-onnx-service.tar
- GET /health → 服务健康状态与推理后端
- POST /predict → 语义中断检测
- 请求体:{"text":"..."}
- 响应体:{"text":"...","status":"完整|不完整","label":1|0,"confidence":0.xx}
pip install "fastapi[all]" onnx onnxruntime transformers numpy uvicorn
python src/server.py
- ONNX 模型路径:models/bert_model/model.onnx
- 若未生成 ONNX,可执行:
python src/export_onnx.py
- Dockerfile:容器构建文件
- start.sh:容器入口脚本(启动 FastAPI 服务)
- src/server.py:ONNX 推理服务
- models/bert_model:模型与分词器