PowerScale: OneFS: Godkjenningsventetid på grunn av unødvendige eksterne SID-spørringer
Summary: I OneFS 9.12 og nyere kan klynger med flere godkjenningsleverandører konfigurert observere ventetid under godkjenning med protokoller. Dette er et resultat av unødvendige og dyre samtaler om informasjon om brukermedlemskap på eksternt hentede SID-er. ...
Symptoms
Berørte klynger kan observere følgende, selv om omfanget og intensiveringen av symptomene kan variere med individuelle arbeidsflyter og konfigurasjon:
- Under installasjonen av SMB-økten kan NTLM- eller Kerberos-godkjenning ta 10–30 sekunder å fullføre, noen ganger lenger.
- NFS-arbeidsflyter kan observere at filtilgangen henger eller stopper i lengre perioder under godkjenning.
- På grunn av tidsavbrudd forårsaket av godkjenningsforsinkelser, kan programmer rapportere tidsavbrudd for tilkobling eller "server svarer ikke"-feil.
- Under travle arbeidsflyter kan de sammensatte godkjenningsforsinkelsene tømme LSASS-tråder. Dette resulterer igjen i at andre operasjoner som er avhengige av LSASS blir latente mens de venter på at LSASS skal behandle forespørslene sine.
- Visning av et tilordningstoken for en bruker demonstrerer en unormal grad av ventetid.
Følgende loggmeldinger kan også være til stede, selv om de ikke utelukkende er en indikasjon på problemet som finnes. Når de er tilstede med ovenstående ventetid, kan de bli mistenkte. Disse meldingene finnes i /var/log/lsassd.log på en node.
Unknown SID <SID> in file provider, trying to resolve as name
Unknown SID <SID> in NIS provider, trying to resolve as name
Unknown SID in LDAP provider, trying to resolve as name
Administratorer kan også observere høyere utgående LDAP-spørringer enn vanlig til Active Directory-domenekontrollere.
Cause
Kodeforbedringer i 9.12+ introduserte flere unødvendige oppslag for ikke-lokale gruppemedlemskap for brukere som utilsiktet la til 5–15 sekunders ventetid per oppslag. Dette er mer uttalt i tilfeller der man ser på gruppemedlemskapet til en bruker som har et stort antall medlemskap, inkludert de fra SID History.
En klynge kan være i faresonen for problemet hvis følgende betingelser er oppfylt:
- Klyngen er på OneFS 9.12 eller nyere.
- Det er flere autentiseringsleverandører til stede.
- Det er et for høyt antall meldinger i /var/log/lsassd.log på berørte noder som prøver å løse eksterne SID som navn.
- Det tar fem sekunder eller lenger å vise en brukers tilordningstoken.
Det er ingen måte å definitivt vite om en klynge vil være i fare for å treffe problemet, da dette er subjektivt for hvert enkelt eksternt autentiseringsmiljø. Når det er sagt, vil det å være på det berørte kodenivået sette en klynge i fare for problemet betydelig i tillegg til de andre elementene som er oppført ovenfor.
Resolution
Løsningen forventes utgitt i:
OneFS 9.15 – utgivelse medu./slutten av august 2026
OneFS 9.13.1.1 – utgivelse august 2026
OneFS 9.14.0.1 – for øyeblikket tilgjengelig
Et middel for å redusere, men ikke helt fjerne ventetid ville være å redusere den negative cachen TTL og trefftelling. Memcache bufrer de mislykkede oppslagene for gruppe-SID som en bruker, men det blir ikke oppført som en negativ oppføring før fem forsøk. Merk at <det må defineres sone> for den aktuelle tilgangssonen du vil bruke disse endringene på, med de relevante kommandoene.
MERK: Pass alltid på at du samler inn standardverdiene for alle systemkonfigurasjoner eller globale konfigurasjoner du planlegger å endre, før du endrer dem, siden de kan variere mellom klynger.
Slik endrer du antall mislykkede oppslag som er nødvendig for å skrive en oppføring til negativ hurtigbuffer til én for en angitt tilgangssone:
# isi_gconfig registry.Services.lsass.Parameters.Zones.<zone>.NegCacheHitsThreshold=1
Hvis parameteren ovenfor ikke finnes for individuelle tilgangssoner, kan den samme verdien også endres globalt.
isi_gconfig registry.Services.lsass.Parameters.NegCacheHitsThreshold=1
Slik forlenger du TTL/levetiden for den negative hurtigbufferoppføringen til fire timer, og reduserer dermed hyppigheten av spørringer:
# isi zone zones modify <Zone> --negative-cache-entry-expiry=4H
Selv om problemet ikke fjernes helt, endres verdiene ovenfor for å konfigurasjonen for å redusere hyppigheten av potensiell ventetid til en gang hver fjerde time. Når du har installert oppdateringen med feilrettingsfeilrettingen for riktig kodenivå, kan klyngeadministratorer tilbakestille verdiene for innstillingene ovenfor til det som tidligere ble angitt.