ESXTOP Disk View – Real Latency Analysis (Production Scenario)



  • 1️⃣ Real Latency analizi – esxtop (Disk View)

    🔹 esxtop başladın

    esxtop
    

    🔹 Disk ekranına keç

    d
    

    🔹 Latency sütunlarını aktiv et (çox vacibdir)

    f
    

    SPACE düyməsi ilə aşağıdakı sütunları seç:

    • DAVG/cmd → Device Latency (Storage)

    • KAVG/cmd → Kernel Latency (ESXi)

    • GAVG/cmd → Guest əməliyyat sisteminin gördüyü Latency

    • QAVG/cmd → Queue Latency


    📊 Latency göstəricilərinin şərhi

    GöstəriciNormalAlarm
    DAVG< 5 ms (Flash)> 20 ms
    KAVG< 1 ms> 2 ms
    QAVG≈ 0> 5 ms
    GAVGDAVG + KAVG

    🔥 Alarm ssenariləri

    DAVG yüksəkdirsə

    ➡️ Problem Storage tərəfindədir.

    QAVG yüksəkdirsə

    ➡️ IO Queue doludur (Multipath və ya Queue problemi).

    KAVG yüksəkdirsə

    ➡️ Problem ESXi, Driver və ya HBA tərəfindədir.

    📌 Multipath problemlərinin təxminən 90%-i QAVG göstəricisində özünü göstərir.


    2️⃣ Hər Path üzrə IO paylanmasını canlı izləmək

    🔹 esxtop → Disk → Path View

    d
    p
    

    Bu ekran:

    • Hər Path üzərindən keçən IO yükünü ayrıca göstərir.

    • Round Robin (RR) düzgün işləyirmi, bunu burada görmək mümkündür.


    Baxılacaq əsas sütunlar

    • CMDS/s

    • READS/s

    • WRITES/s

    • LAT/rd

    • LAT/wr


    🔹 Sağlam Round Robin necə görünməlidir?

    • Path-lər arasında IO yükü balanslı olmalıdır.

    • Bir Path üzərində yük 90%-ə çatırsa ❌ normal deyil.

    📌 Əgər yalnız bir Path üzərindən IO gedirsə:

    ➡️ Round Robin işləmir və ya Fixed PSP aktivdir.


    3️⃣ PSP dəyişdirildikdən sonra performans necə ölçülməlidir?

    🔹 Addım-addım düzgün metod

    1️⃣ Dəyişiklikdən əvvəl Snapshot götür

    Qeyd et:

    • esxtop orta göstəriciləri

    • Latency dəyərləri

    • IO paylanması


    2️⃣ PSP dəyişdir

    esxcli storage nmp device set -d naa.xxx -p VMW_PSP_RR
    

    Daha sonra IOPS=1 təyin et:

    esxcli storage nmp psp roundrobin deviceconfig set \
    -d naa.xxx -t iops -I 1 -U true
    

    3️⃣ Yük altında ölç

    • Production workload işləyərkən test apar.

    • esxtop ilə 5–10 dəqiqə müşahidə et.


    📈 Gözlənilən nəticələr

    MetrikƏvvəlSonra
    DAVGYüksək
    QAVGYüksək⬇⬇
    Path IOBalanssızBalanslı

    📌 Yalnız boş vəziyyətdə (Idle) aparılan ölçmələr düzgün nəticə vermir.


    4️⃣ Yanlış Multipath konfiqurasiyasının "Red Flag" göstəriciləri 🚨

    Bu əlamətləri görürsənsə, konfiqurasiyanı ətraflı yoxla.


    ❌ Red Flag #1

    Round Robin aktiv görünür, amma yalnız bir Path üzərindən IO keçir.

    ➡️ Mümkün səbəblər:

    • ALUA Non-Optimized Path

    • Storage Active/Passive konfiqurasiyası


    ❌ Red Flag #2

    QAVG davamlı olaraq yüksəkdir.

    ➡️ Mümkün səbəblər:

    • Queue Depth aşağıdır.

    • Round Robin + çox Path + IOPS=1 kombinasiyası balanssız işləyir.


    ❌ Red Flag #3

    Latency dəyərləri qəfil yüksəlib-enir.

    ➡️ Mümkün səbəblər:

    • Path Thrashing

    • Yanlış PSP

    • IOPS dəyərinin həddindən artıq aşağı və ya yüksək olması


    ❌ Red Flag #4

    APD və ya PDL hadisələri müşahidə olunur.

    Yoxlanılacaq log:

    /var/log/vmkernel.log
    

    ➡️ Multipath Failover problemi ehtimalı yüksəkdir.


    ❌ Red Flag #5

    Storage sürətlidir, amma VM yavaşdır.

    ➡️ Təxminən 80% ehtimalla səbəb:

    • Yanlış PSP

    • Round Robin Default (1000 IOPS)

    • Yanlış Queue konfiqurasiyası


    🧠 Mini diaqnostika checklist (yadda saxla)

    esxtop → DAVG / KAVG / QAVG

    Path View → IO balanslı paylanırmı?

    PSP = Round Robin (RR)?

    IOPS = 1?

    Queue Depth məntiqli dəyərdədir?

    Vendor Best Practice Guide-a uyğundur?


    🔥 Son söz (real mühitdən)

    "Latency problemlərinin əsas səbəbi hər zaman Storage deyil. Real mühitdə problemlərin təxminən 70%-i Multipath və Queue konfiqurasiyasından qaynaqlanır."

Комментарии