apiVersion: v1 kind: ConfigMap metadata: name: {{ include "iaop.fullname" . }}-backend labels: {{- include "iaop.labels" . | nindent 4 }} data: # 推理后端适配层配置(PRD 5.6:切换后端仅改 values.inference.backend)。 # 该配置与 core/inference-backend/config/backends.template.yaml 同构, # 由推理服务容器在启动时读取。 backends.yaml: | template: ti-cl4 version: 1.0.0 backend: {{ .Values.inference.backend }} inference: model: {{ .Values.inference.model | quote }} endpoint: http://{{ include "iaop.fullname" . }}:{{ .Values.service.port }}/v1 timeout_seconds: {{ .Values.inference.timeoutSeconds }} runtime: {{ .Values.inference.runtime | quote }} device: {{ .Values.inference.device | quote }} max_tokens: {{ .Values.inference.maxTokens }} temperature: {{ .Values.inference.temperature }} {{- if eq .Values.inference.backend "npu" }} # 昇腾适配层专用字段(CANN 工具链版本;gpu 后端忽略) cann_version: {{ .Values.inference.cannVersion | default "" | quote }} {{- end }} resources: requests: cpu: {{ .Values.resources.requests.cpu | quote }} memory: {{ .Values.resources.requests.memory | quote }} limits: cpu: {{ .Values.resources.limits.cpu | quote }} memory: {{ .Values.resources.limits.memory | quote }} rollingUpdate: maxUnavailable: {{ .Values.rollingUpdate.maxUnavailable }} maxSurge: {{ .Values.rollingUpdate.maxSurge }}