37 lines
1.5 KiB
YAML
37 lines
1.5 KiB
YAML
apiVersion: v1
|
|
kind: ConfigMap
|
|
metadata:
|
|
name: {{ include "iaop.fullname" . }}-backend
|
|
labels:
|
|
{{- include "iaop.labels" . | nindent 4 }}
|
|
data:
|
|
# 推理后端适配层配置(PRD 5.6:切换后端仅改 values.inference.backend)。
|
|
# 该配置与 core/inference-backend/config/backends.template.yaml 同构,
|
|
# 由推理服务容器在启动时读取。
|
|
backends.yaml: |
|
|
template: ti-cl4
|
|
version: 1.0.0
|
|
backend: {{ .Values.inference.backend }}
|
|
inference:
|
|
model: {{ .Values.inference.model | quote }}
|
|
endpoint: http://{{ include "iaop.fullname" . }}:{{ .Values.service.port }}/v1
|
|
timeout_seconds: {{ .Values.inference.timeoutSeconds }}
|
|
runtime: {{ .Values.inference.runtime | quote }}
|
|
device: {{ .Values.inference.device | quote }}
|
|
max_tokens: {{ .Values.inference.maxTokens }}
|
|
temperature: {{ .Values.inference.temperature }}
|
|
{{- if eq .Values.inference.backend "npu" }}
|
|
# 昇腾适配层专用字段(CANN 工具链版本;gpu 后端忽略)
|
|
cann_version: {{ .Values.inference.cannVersion | default "" | quote }}
|
|
{{- end }}
|
|
resources:
|
|
requests:
|
|
cpu: {{ .Values.resources.requests.cpu | quote }}
|
|
memory: {{ .Values.resources.requests.memory | quote }}
|
|
limits:
|
|
cpu: {{ .Values.resources.limits.cpu | quote }}
|
|
memory: {{ .Values.resources.limits.memory | quote }}
|
|
rollingUpdate:
|
|
maxUnavailable: {{ .Values.rollingUpdate.maxUnavailable }}
|
|
maxSurge: {{ .Values.rollingUpdate.maxSurge }}
|