Files
iAOP/deploy/k8s/helm/iaop/templates/backend-configmap.yaml

37 lines
1.5 KiB
YAML

apiVersion: v1
kind: ConfigMap
metadata:
name: {{ include "iaop.fullname" . }}-backend
labels:
{{- include "iaop.labels" . | nindent 4 }}
data:
# 推理后端适配层配置(PRD 5.6:切换后端仅改 values.inference.backend)。
# 该配置与 core/inference-backend/config/backends.template.yaml 同构,
# 由推理服务容器在启动时读取。
backends.yaml: |
template: ti-cl4
version: 1.0.0
backend: {{ .Values.inference.backend }}
inference:
model: {{ .Values.inference.model | quote }}
endpoint: http://{{ include "iaop.fullname" . }}:{{ .Values.service.port }}/v1
timeout_seconds: {{ .Values.inference.timeoutSeconds }}
runtime: {{ .Values.inference.runtime | quote }}
device: {{ .Values.inference.device | quote }}
max_tokens: {{ .Values.inference.maxTokens }}
temperature: {{ .Values.inference.temperature }}
{{- if eq .Values.inference.backend "npu" }}
# 昇腾适配层专用字段(CANN 工具链版本;gpu 后端忽略)
cann_version: {{ .Values.inference.cannVersion | default "" | quote }}
{{- end }}
resources:
requests:
cpu: {{ .Values.resources.requests.cpu | quote }}
memory: {{ .Values.resources.requests.memory | quote }}
limits:
cpu: {{ .Values.resources.limits.cpu | quote }}
memory: {{ .Values.resources.limits.memory | quote }}
rollingUpdate:
maxUnavailable: {{ .Values.rollingUpdate.maxUnavailable }}
maxSurge: {{ .Values.rollingUpdate.maxSurge }}