---
name: Qdrant Latency Optimization
slug: qdrant-latency-optimization
category: DevOps
description: Qdrant Latency Optimization guides how to reduce single-query and tail latency in Qdrant. Use it when search is slow, p99 is high, or you need faster vector search on a Qdrant node.
github: "https://github.com/qdrant/skills/tree/main/skills/qdrant-scaling/minimize-latency"
language: Python
stars: 230
forks: 28
install: "npx degit https://github.com/qdrant/skills/tree/main/skills/qdrant-scaling/minimize-latency ~/.claude/skills/minimize-latency"
installs_to: ~/.claude/skills/minimize-latency
source_path: skills/qdrant-scaling/minimize-latency/SKILL.md
collection_size: 25
category_size: 868
collection_url: "https://dirskills.com/collections/qdrant/skills"
added: 2026-09-03T06:04:29.344Z
last_synced: 2026-09-03T06:04:29.344Z
canonical_url: "https://dirskills.com/skills/qdrant-latency-optimization"
---

# Qdrant Latency Optimization

Qdrant Latency Optimization guides how to reduce single-query and tail latency in Qdrant. Use it when search is slow, p99 is high, or you need faster vector search on a Qdrant node.

**Install:**

```bash
npx degit https://github.com/qdrant/skills/tree/main/skills/qdrant-scaling/minimize-latency ~/.claude/skills/minimize-latency
```

## README

# Scaling for Query Latency

Latency of a single query is determined by the slowest component in the query execution path. It is sometimes correlated with throughput, but not always — throughput and latency are opposite tuning directions.

Low latency optimization is aimed at utilising maximum resource saturation for a single query, while throughput optimization is aimed at minimizing per-query resource usage to allow more parallel queries.

## Performance Tuning for Lower Latency

- Increase segment count to match CPU cores (`default_segment_number: 16`) [Minimizing latency](https://skills.qdrant.tech/md/documentation/ops-optimization/optimize/?s=minimizing-latency)
- Keep quantized vectors and HNSW in RAM: `memory: pinned` on Qdrant 1.19 or newer, `always_ram: true` on 1.18 or older
- Reduce `hnsw_ef` at query time (trade recall for speed) [Search params](https://skills.qdrant.tech/md/documentation/ops-optimization/optimize/?s=fine-tuning-search-parameters)
- Use local NVMe, avoid network-attached storage

## Memory Pressure and Latency

RAM is the most critical resource for latency. If working set exceeds available RAM, OS cache eviction causes severe, sustained latency degradation.

- Vertical scale RAM first. Critical if working set >80%.
- Use quantization: scalar (4x reduction) or binary (16x reduction) [Quantization](https://skills.qdrant.tech/md/documentation/manage-data/quantization/)
- Move payload indexes to disk if filtering is infrequent: `memory: cold` on Qdrant 1.19 or newer, `on_disk: true` on 1.18 or older [On-disk payload index](https://skills.qdrant.tech/md/documentation/manage-data/indexing/?s=on-disk-payload-index)
- Set `optimizer_cpu_budget` to limit background optimization CPUs
- Schedule indexing: set high `indexing_threshold` during peak hours


## Vertical Scaling for Latency

More RAM and faster CPU directly reduce latency. See [Vertical Scaling](../scaling-data-volume/vertical-scaling/SKILL.md) for node sizing guidelines.


## What NOT to Do

- Do not expect to optimize latency and throughput simultaneously on the same node
- Do not use few large segments for latency-sensitive workloads (each segment takes longer to search)
- Do not run at >90% RAM (cache eviction causes severe latency degradation that can last days)
- Do not ignore optimizer status during performance debugging
- Do not scale down RAM without load testing (cache eviction causes days-long latency incidents)
