feat(#58): GPU 后端实现(NVIDIA Triton/ONNX,PRD 5.6 推理后端可插拔)

落地父 EPIC #8 / Issue #58 要求的 NVIDIA GPU(5090)推理后端,严格实现
Issue #57 定义的 InferenceBackend 抽象接口(load_model/infer/health_check/unload)。

新增 core/llm-gateway/gpu_backend.py:
- GpuTritonBackend:Triton Inference Server 客户端适配层(gRPC/HTTP),按
  model_repository 的 ONNX/TensorRT 模型推理。
- 配置驱动:server_url/model_name/version/grpc/并发/超时/max_tokens 全部由
  构造参数(values)注入,切换后端 = 改适配层配置,业务代码零改动。
- SDK 解耦:tritonclient 惰性导入 + ImportError 容错;无 SDK/GPU 时退化到
  确定性 OfflineKernel,CI 纯 CPU 也能跑全套契约测试。
- fail-closed:未 load_model 即 infer 抛 RuntimeError(生产严格)。
- 健康探针:is_server_live + is_model_ready 双判定,供 #61 监控消费。
- 审计:infer 返回 InferResult(text/token 计数/latency_ms)。

注册表接入:default_registry() 登记 gpu-triton,build_backend 可配置切换。

新增 core/llm-gateway/tests/test_gpu_backend.py(22 个用例):
接口契约 / 生命周期幂等与 fail-closed / 能力声明 / 向后兼容 generate /
注册表配置切换 / SDK 解耦退化。

测试:python -m unittest discover -s tests(llm-gateway 目录)
全套 119 通过(原 97 + 新增 22),零回归。
This commit is contained in:
2026-08-04 21:55:40 +08:00
parent 03ae81a217
commit 818f1db860
3 changed files with 492 additions and 0 deletions
+239
View File
@@ -0,0 +1,239 @@
# -*- coding: utf-8 -*-
"""NVIDIA GPU 推理后端(gpu_backend,Issue #58,PRD 5.6)单元测试。
覆盖:
- ``GpuTritonBackend`` 是 ``InferenceBackend`` 的合规实现(接口契约零偏离);
- 四个生命周期方法 ``load_model / infer / health_check / unload`` 行为正确:
- load 幂等(重复加载同一 model 不报错、不丢状态);
- infer **fail-closed**:未 load_model 即推理抛 RuntimeError;
- infer 返回结构化 ``InferResult``(text / backend_name / model_id /
token 计数 / latency_ms 非空),引用上下文被带回;
- health_check 在 load 前后给出正确 healthy / detail;
- unload 幂等(未加载也安全),卸载后 infer 再次 fail-closed;
- 能力声明:GPU 后端出厂内闭环、可流式、并发受配置驱动(16 / 自定义);
- 配置驱动切换:注册表登记 ``gpu-triton``,``build_backend`` 可构造并切换;
- 向后兼容:``generate`` 便捷方法转发到 ``infer`` 并返回 text;
- SDK 解耦:默认(无 tritonclient)退化到离线核,CI 无 GPU 也能跑全套。
"""
import os
import sys
import unittest
from abc import ABC
sys.path.insert(0, os.path.dirname(os.path.abspath(__file__)))
import _bootstrap # noqa: F401
from llm_gateway.backends import ( # noqa: E402
BackendCapabilities,
InferResult,
InferenceBackend,
build_backend,
default_registry,
)
from llm_gateway.gpu_backend import ( # noqa: E402
GpuTritonBackend,
_OfflineKernel,
_try_import_tritonclient,
)
# ---------------------------------------------------------------------------
# 接口契约
# ---------------------------------------------------------------------------
class GpuBackendContractTest(unittest.TestCase):
"""PRD 5.6:GPU 后端必须落地 InferenceBackend 契约。"""
def test_is_inference_backend(self):
self.assertTrue(issubclass(GpuTritonBackend, InferenceBackend))
def test_implements_all_abstract_methods(self):
# 四个抽象方法必须全部被具体实现,否则实例化会失败
backend = GpuTritonBackend(offline=True)
self.assertIsInstance(backend, InferenceBackend)
# 抽象方法集合在子类中应为空
self.assertFalse(GpuTritonBackend.__abstractmethods__)
def test_default_name(self):
self.assertEqual(GpuTritonBackend.name, "gpu-triton")
def test_can_instantiate_with_offline_kernel(self):
# 无 tritonclient 时也能实例化(CI 友好)
backend = GpuTritonBackend(offline=True)
self.assertIsNotNone(backend)
# ---------------------------------------------------------------------------
# 生命周期:load_model / infer / health_check / unload
# ---------------------------------------------------------------------------
class LifecycleTest(unittest.TestCase):
def setUp(self):
self.backend = GpuTritonBackend(
offline=True, model_name="llm-70b-onnx", max_tokens=128)
def test_load_is_idempotent(self):
self.backend.load_model("llm-70b-onnx")
self.assertTrue(self.backend._loaded)
# 重复加载同一模型不报错、状态保持
self.backend.load_model("llm-70b-onnx")
self.assertTrue(self.backend._loaded)
self.assertEqual(self.backend._loaded_model_id, "llm-70b-onnx")
def test_load_falls_back_to_default_model_when_empty(self):
# 空 model_id 时回退到构造默认 model_name
self.backend.load_model("")
self.assertEqual(self.backend._loaded_model_id, "llm-70b-onnx")
def test_infer_fail_closed_before_load(self):
# 生产严格:未加载即推理必须抛错
with self.assertRaises(RuntimeError):
self.backend.infer("ping")
def test_infer_returns_structured_result(self):
self.backend.load_model("llm-70b-onnx")
result = self.backend.infer("海绵钛还蒸能耗?", context=["SOP-A", "国标-B"])
self.assertIsInstance(result, InferResult)
self.assertEqual(result.backend_name, "gpu-triton")
self.assertEqual(result.model_id, "llm-70b-onnx")
self.assertIn("海绵钛还蒸能耗?", result.text)
# 引用溯源:上下文被带回
self.assertIn("[来源: SOP-A]", result.text)
self.assertIn("[来源: 国标-B]", result.text)
# 审计字段
self.assertIsNotNone(result.prompt_tokens)
self.assertGreater(result.prompt_tokens, 0)
self.assertIsNotNone(result.completion_tokens)
self.assertGreater(result.completion_tokens, 0)
self.assertIsNotNone(result.latency_ms)
self.assertGreaterEqual(result.latency_ms, 0.0)
def test_health_check_before_load(self):
health = self.backend.health_check()
self.assertFalse(health.healthy)
self.assertIn("loaded=False", health.detail)
def test_health_check_after_load(self):
self.backend.load_model("llm-70b-onnx")
health = self.backend.health_check()
# 离线核 load 后 server_live + model_ready 均为真
self.assertTrue(health.healthy)
self.assertIn("server_live=True", health.detail)
self.assertIn("model_ready=True", health.detail)
self.assertIn("loaded=True", health.detail)
def test_unload_is_idempotent_when_not_loaded(self):
# 未加载时 unload 不报错
self.backend.unload()
self.assertFalse(self.backend._loaded)
def test_unload_disables_inference(self):
self.backend.load_model("llm-70b-onnx")
self.backend.infer("ok")
self.backend.unload()
self.assertFalse(self.backend._loaded)
# 卸载后再次推理应 fail-closed
with self.assertRaises(RuntimeError):
self.backend.infer("ok")
def test_reload_after_unload(self):
self.backend.load_model("llm-70b-onnx")
self.backend.unload()
# 可重新加载并推理
self.backend.load_model("llm-70b-onnx")
result = self.backend.infer("again")
self.assertIn("again", result.text)
# ---------------------------------------------------------------------------
# 能力声明
# ---------------------------------------------------------------------------
class CapabilitiesTest(unittest.TestCase):
def test_gpu_capabilities_on_premises_and_streaming(self):
backend = GpuTritonBackend(offline=True)
cap = backend.capabilities
self.assertIsInstance(cap, BackendCapabilities)
# GPU 后端数据不出厂、支持流式
self.assertTrue(cap.on_premises)
self.assertTrue(cap.streaming)
self.assertIn("text", cap.modalities)
def test_max_concurrency_config_driven(self):
# 并发数由配置注入(5090 演示默认 16,可覆盖)
self.assertEqual(
GpuTritonBackend(offline=True).capabilities.max_concurrency, 16)
self.assertEqual(
GpuTritonBackend(offline=True, max_concurrency=32)
.capabilities.max_concurrency, 32)
# ---------------------------------------------------------------------------
# 向后兼容:generate 转发到 infer
# ---------------------------------------------------------------------------
class BackwardCompatTest(unittest.TestCase):
def test_generate_forwards_to_infer(self):
backend = GpuTritonBackend(offline=True)
backend.load_model("llm-70b-onnx")
text = backend.generate("能耗预测", ["SOP-A"])
self.assertIsInstance(text, str)
self.assertIn("能耗预测", text)
self.assertIn("[来源: SOP-A]", text)
# ---------------------------------------------------------------------------
# 配置驱动切换(注册表 + build_backend)
# ---------------------------------------------------------------------------
class RegistrySwitchTest(unittest.TestCase):
def test_registered_in_default_registry(self):
registry = default_registry()
self.assertIn("gpu-triton", registry)
self.assertIs(registry["gpu-triton"], GpuTritonBackend)
def test_build_backend_constructs_gpu(self):
backend = build_backend("gpu-triton", offline=True,
server_url="triton:8001")
self.assertIsInstance(backend, GpuTritonBackend)
self.assertEqual(backend.server_url, "triton:8001")
self.assertEqual(backend.name, "gpu-triton")
def test_build_backend_unknown_raises(self):
with self.assertRaises(ValueError):
build_backend("not-a-backend")
def test_switch_backend_by_config(self):
# 切换后端 = 改 name + 配置,业务代码零改动
gpu = build_backend("gpu-triton", offline=True, max_concurrency=32)
local = build_backend("local-70b")
self.assertNotEqual(gpu.name, local.name)
self.assertEqual(gpu.capabilities.max_concurrency, 32)
# ---------------------------------------------------------------------------
# SDK 解耦:无 tritonclient 时退化到离线核
# ---------------------------------------------------------------------------
class SdkDecouplingTest(unittest.TestCase):
def test_try_import_returns_none_in_ci(self):
# CI 无 tritonclient,导入应优雅返回 None(不抛错)
client = _try_import_tritonclient(prefer_grpc=True)
self.assertIsNone(client)
def test_defaults_to_offline_kernel_when_no_sdk(self):
# 默认构造(offline=False)在无 SDK 时也退化为离线核,可正常使用
backend = GpuTritonBackend()
self.assertIsInstance(backend._kernel, _OfflineKernel)
backend.load_model("llm-70b-onnx")
self.assertTrue(backend.health_check().healthy)
if __name__ == "__main__":
unittest.main()