feat(#58): GPU 后端实现(NVIDIA Triton/ONNX,PRD 5.6 推理后端可插拔)
落地父 EPIC #8 / Issue #58 要求的 NVIDIA GPU(5090)推理后端,严格实现 Issue #57 定义的 InferenceBackend 抽象接口(load_model/infer/health_check/unload)。 新增 core/llm-gateway/gpu_backend.py: - GpuTritonBackend:Triton Inference Server 客户端适配层(gRPC/HTTP),按 model_repository 的 ONNX/TensorRT 模型推理。 - 配置驱动:server_url/model_name/version/grpc/并发/超时/max_tokens 全部由 构造参数(values)注入,切换后端 = 改适配层配置,业务代码零改动。 - SDK 解耦:tritonclient 惰性导入 + ImportError 容错;无 SDK/GPU 时退化到 确定性 OfflineKernel,CI 纯 CPU 也能跑全套契约测试。 - fail-closed:未 load_model 即 infer 抛 RuntimeError(生产严格)。 - 健康探针:is_server_live + is_model_ready 双判定,供 #61 监控消费。 - 审计:infer 返回 InferResult(text/token 计数/latency_ms)。 注册表接入:default_registry() 登记 gpu-triton,build_backend 可配置切换。 新增 core/llm-gateway/tests/test_gpu_backend.py(22 个用例): 接口契约 / 生命周期幂等与 fail-closed / 能力声明 / 向后兼容 generate / 注册表配置切换 / SDK 解耦退化。 测试:python -m unittest discover -s tests(llm-gateway 目录) 全套 119 通过(原 97 + 新增 22),零回归。
This commit is contained in:
@@ -0,0 +1,239 @@
|
||||
# -*- coding: utf-8 -*-
|
||||
"""NVIDIA GPU 推理后端(gpu_backend,Issue #58,PRD 5.6)单元测试。
|
||||
|
||||
覆盖:
|
||||
- ``GpuTritonBackend`` 是 ``InferenceBackend`` 的合规实现(接口契约零偏离);
|
||||
- 四个生命周期方法 ``load_model / infer / health_check / unload`` 行为正确:
|
||||
- load 幂等(重复加载同一 model 不报错、不丢状态);
|
||||
- infer **fail-closed**:未 load_model 即推理抛 RuntimeError;
|
||||
- infer 返回结构化 ``InferResult``(text / backend_name / model_id /
|
||||
token 计数 / latency_ms 非空),引用上下文被带回;
|
||||
- health_check 在 load 前后给出正确 healthy / detail;
|
||||
- unload 幂等(未加载也安全),卸载后 infer 再次 fail-closed;
|
||||
- 能力声明:GPU 后端出厂内闭环、可流式、并发受配置驱动(16 / 自定义);
|
||||
- 配置驱动切换:注册表登记 ``gpu-triton``,``build_backend`` 可构造并切换;
|
||||
- 向后兼容:``generate`` 便捷方法转发到 ``infer`` 并返回 text;
|
||||
- SDK 解耦:默认(无 tritonclient)退化到离线核,CI 无 GPU 也能跑全套。
|
||||
"""
|
||||
import os
|
||||
import sys
|
||||
import unittest
|
||||
from abc import ABC
|
||||
|
||||
sys.path.insert(0, os.path.dirname(os.path.abspath(__file__)))
|
||||
import _bootstrap # noqa: F401
|
||||
|
||||
from llm_gateway.backends import ( # noqa: E402
|
||||
BackendCapabilities,
|
||||
InferResult,
|
||||
InferenceBackend,
|
||||
build_backend,
|
||||
default_registry,
|
||||
)
|
||||
from llm_gateway.gpu_backend import ( # noqa: E402
|
||||
GpuTritonBackend,
|
||||
_OfflineKernel,
|
||||
_try_import_tritonclient,
|
||||
)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 接口契约
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class GpuBackendContractTest(unittest.TestCase):
|
||||
"""PRD 5.6:GPU 后端必须落地 InferenceBackend 契约。"""
|
||||
|
||||
def test_is_inference_backend(self):
|
||||
self.assertTrue(issubclass(GpuTritonBackend, InferenceBackend))
|
||||
|
||||
def test_implements_all_abstract_methods(self):
|
||||
# 四个抽象方法必须全部被具体实现,否则实例化会失败
|
||||
backend = GpuTritonBackend(offline=True)
|
||||
self.assertIsInstance(backend, InferenceBackend)
|
||||
# 抽象方法集合在子类中应为空
|
||||
self.assertFalse(GpuTritonBackend.__abstractmethods__)
|
||||
|
||||
def test_default_name(self):
|
||||
self.assertEqual(GpuTritonBackend.name, "gpu-triton")
|
||||
|
||||
def test_can_instantiate_with_offline_kernel(self):
|
||||
# 无 tritonclient 时也能实例化(CI 友好)
|
||||
backend = GpuTritonBackend(offline=True)
|
||||
self.assertIsNotNone(backend)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 生命周期:load_model / infer / health_check / unload
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class LifecycleTest(unittest.TestCase):
|
||||
def setUp(self):
|
||||
self.backend = GpuTritonBackend(
|
||||
offline=True, model_name="llm-70b-onnx", max_tokens=128)
|
||||
|
||||
def test_load_is_idempotent(self):
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
self.assertTrue(self.backend._loaded)
|
||||
# 重复加载同一模型不报错、状态保持
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
self.assertTrue(self.backend._loaded)
|
||||
self.assertEqual(self.backend._loaded_model_id, "llm-70b-onnx")
|
||||
|
||||
def test_load_falls_back_to_default_model_when_empty(self):
|
||||
# 空 model_id 时回退到构造默认 model_name
|
||||
self.backend.load_model("")
|
||||
self.assertEqual(self.backend._loaded_model_id, "llm-70b-onnx")
|
||||
|
||||
def test_infer_fail_closed_before_load(self):
|
||||
# 生产严格:未加载即推理必须抛错
|
||||
with self.assertRaises(RuntimeError):
|
||||
self.backend.infer("ping")
|
||||
|
||||
def test_infer_returns_structured_result(self):
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
result = self.backend.infer("海绵钛还蒸能耗?", context=["SOP-A", "国标-B"])
|
||||
self.assertIsInstance(result, InferResult)
|
||||
self.assertEqual(result.backend_name, "gpu-triton")
|
||||
self.assertEqual(result.model_id, "llm-70b-onnx")
|
||||
self.assertIn("海绵钛还蒸能耗?", result.text)
|
||||
# 引用溯源:上下文被带回
|
||||
self.assertIn("[来源: SOP-A]", result.text)
|
||||
self.assertIn("[来源: 国标-B]", result.text)
|
||||
# 审计字段
|
||||
self.assertIsNotNone(result.prompt_tokens)
|
||||
self.assertGreater(result.prompt_tokens, 0)
|
||||
self.assertIsNotNone(result.completion_tokens)
|
||||
self.assertGreater(result.completion_tokens, 0)
|
||||
self.assertIsNotNone(result.latency_ms)
|
||||
self.assertGreaterEqual(result.latency_ms, 0.0)
|
||||
|
||||
def test_health_check_before_load(self):
|
||||
health = self.backend.health_check()
|
||||
self.assertFalse(health.healthy)
|
||||
self.assertIn("loaded=False", health.detail)
|
||||
|
||||
def test_health_check_after_load(self):
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
health = self.backend.health_check()
|
||||
# 离线核 load 后 server_live + model_ready 均为真
|
||||
self.assertTrue(health.healthy)
|
||||
self.assertIn("server_live=True", health.detail)
|
||||
self.assertIn("model_ready=True", health.detail)
|
||||
self.assertIn("loaded=True", health.detail)
|
||||
|
||||
def test_unload_is_idempotent_when_not_loaded(self):
|
||||
# 未加载时 unload 不报错
|
||||
self.backend.unload()
|
||||
self.assertFalse(self.backend._loaded)
|
||||
|
||||
def test_unload_disables_inference(self):
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
self.backend.infer("ok")
|
||||
self.backend.unload()
|
||||
self.assertFalse(self.backend._loaded)
|
||||
# 卸载后再次推理应 fail-closed
|
||||
with self.assertRaises(RuntimeError):
|
||||
self.backend.infer("ok")
|
||||
|
||||
def test_reload_after_unload(self):
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
self.backend.unload()
|
||||
# 可重新加载并推理
|
||||
self.backend.load_model("llm-70b-onnx")
|
||||
result = self.backend.infer("again")
|
||||
self.assertIn("again", result.text)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 能力声明
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class CapabilitiesTest(unittest.TestCase):
|
||||
def test_gpu_capabilities_on_premises_and_streaming(self):
|
||||
backend = GpuTritonBackend(offline=True)
|
||||
cap = backend.capabilities
|
||||
self.assertIsInstance(cap, BackendCapabilities)
|
||||
# GPU 后端数据不出厂、支持流式
|
||||
self.assertTrue(cap.on_premises)
|
||||
self.assertTrue(cap.streaming)
|
||||
self.assertIn("text", cap.modalities)
|
||||
|
||||
def test_max_concurrency_config_driven(self):
|
||||
# 并发数由配置注入(5090 演示默认 16,可覆盖)
|
||||
self.assertEqual(
|
||||
GpuTritonBackend(offline=True).capabilities.max_concurrency, 16)
|
||||
self.assertEqual(
|
||||
GpuTritonBackend(offline=True, max_concurrency=32)
|
||||
.capabilities.max_concurrency, 32)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 向后兼容:generate 转发到 infer
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class BackwardCompatTest(unittest.TestCase):
|
||||
def test_generate_forwards_to_infer(self):
|
||||
backend = GpuTritonBackend(offline=True)
|
||||
backend.load_model("llm-70b-onnx")
|
||||
text = backend.generate("能耗预测", ["SOP-A"])
|
||||
self.assertIsInstance(text, str)
|
||||
self.assertIn("能耗预测", text)
|
||||
self.assertIn("[来源: SOP-A]", text)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 配置驱动切换(注册表 + build_backend)
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class RegistrySwitchTest(unittest.TestCase):
|
||||
def test_registered_in_default_registry(self):
|
||||
registry = default_registry()
|
||||
self.assertIn("gpu-triton", registry)
|
||||
self.assertIs(registry["gpu-triton"], GpuTritonBackend)
|
||||
|
||||
def test_build_backend_constructs_gpu(self):
|
||||
backend = build_backend("gpu-triton", offline=True,
|
||||
server_url="triton:8001")
|
||||
self.assertIsInstance(backend, GpuTritonBackend)
|
||||
self.assertEqual(backend.server_url, "triton:8001")
|
||||
self.assertEqual(backend.name, "gpu-triton")
|
||||
|
||||
def test_build_backend_unknown_raises(self):
|
||||
with self.assertRaises(ValueError):
|
||||
build_backend("not-a-backend")
|
||||
|
||||
def test_switch_backend_by_config(self):
|
||||
# 切换后端 = 改 name + 配置,业务代码零改动
|
||||
gpu = build_backend("gpu-triton", offline=True, max_concurrency=32)
|
||||
local = build_backend("local-70b")
|
||||
self.assertNotEqual(gpu.name, local.name)
|
||||
self.assertEqual(gpu.capabilities.max_concurrency, 32)
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# SDK 解耦:无 tritonclient 时退化到离线核
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
|
||||
class SdkDecouplingTest(unittest.TestCase):
|
||||
def test_try_import_returns_none_in_ci(self):
|
||||
# CI 无 tritonclient,导入应优雅返回 None(不抛错)
|
||||
client = _try_import_tritonclient(prefer_grpc=True)
|
||||
self.assertIsNone(client)
|
||||
|
||||
def test_defaults_to_offline_kernel_when_no_sdk(self):
|
||||
# 默认构造(offline=False)在无 SDK 时也退化为离线核,可正常使用
|
||||
backend = GpuTritonBackend()
|
||||
self.assertIsInstance(backend._kernel, _OfflineKernel)
|
||||
backend.load_model("llm-70b-onnx")
|
||||
self.assertTrue(backend.health_check().healthy)
|
||||
|
||||
|
||||
if __name__ == "__main__":
|
||||
unittest.main()
|
||||
Reference in New Issue
Block a user