diff --git a/kubernetes/ai/llmkube/models/embed.yaml b/kubernetes/ai/llmkube/models/embed.yaml index 9e65131a2..b68b9a148 100644 --- a/kubernetes/ai/llmkube/models/embed.yaml +++ b/kubernetes/ai/llmkube/models/embed.yaml @@ -22,7 +22,7 @@ spec: # CPU embedding service for the ToolHive gateway tool search. # Bound concurrent embedding work: eight slots and 2048-token batches # exceeded the 4Gi limit during ToolHive indexing. - image: ghcr.io/ggml-org/llama.cpp:server@sha256:af8c29600d1de84945de13fa7f126d06fdae16c4b19dc7db1c69c74287eae257 + image: ghcr.io/ggml-org/llama.cpp:server@sha256:33868c035b21dc63f7c60b7438774283fd99215bc319114eb03de5df4ce7cd6b replicas: 1 contextSize: 8192 parallelSlots: 2