ClusterLT logotipas ClusterLT Susisiekite
Susisiekite

DBSCAN: Didelių Duomenų Rūšiavimas Be Išankstinės Grupių Skaičiaus

DBSCAN algoritmas skiriasi nuo K-Means tuo, kad jums nereikia iš anksto žinoti, kiek segmentų reikalinga. Tai idealus sprendimas, kai dirbate su dideliais duomenų rinkiniais ir norite rasti natūralias klientų grupes.

14 min skaitymo Vidutinis lygis Birželis 2026
Verslo komanda aptaria klientų segmentavimo rezultatus aplink lentelę
ClusterLT Redakcinis Kolektyvas

Autorius

ClusterLT Redakcinis Kolektyvas

Redakcinis Kolektyvas

Kodėl DBSCAN skiriasi nuo kitų algoritmų?

Kai naudojate K-Means, turite nuspręsti iš anksto: noriu 5 grupes, arba 10, arba 3. Bet ką daryti, jei nežinote? DBSCAN išsprendžia šią problemą. Algoritmas pats randa grupes, žiūrėdamas, kaip artimi vienas kitam yra duomenys. Tai leidžia atrasti natūralius šablonusgrupuose, kurie tikrai egzistuoja jūsų duomenyse.

Šis metodas yra ypač naudingas versle, kai segmentuojate klientus pagal jų elgesį. Gali būti, kad jūsų duomenys atsiskleidžia keturias natūralias grupes, o ne tas skaičius, kurį jūs laukėte. DBSCAN tai randa automatiškai.

Duomenų klasteriai vaizduojami skirtingomis spalvomis ir grupavimo šablonais
Diagramoje parodyta, kaip algoritmas skaičiuoja atstumą tarp taškų ir surado grupes

Kaip veikia DBSCAN?

DBSCAN remiasi paprastu principu: jei du taškai yra pakankamai arti vienas kito, jie priklauso tai pačiai grupei. Algoritmas pradeda nuo vieno atsitiktinio taško ir baigia surandant visus artimus taškus – šitaip susidaro grupavirtas „klasteris".

1

Pasirinkti pradžios tašką

Algoritmas pradeda nuo atsitiktinio neaplankyto duomenų taško ir apžiūri jo aplinką.

2

Rasti kaimynus

Jis ieško visų taškų, kurie yra per nurodytą atstumą (eps parametras). Jei randa mažiausiai tam tikrą skaičių taškų, tai yra klasterio sėkla.

3

Plėsti grupę

Tada jis rekursyviai prideda visus artimus taškus ir jų kaimynus prie tos pačios grupės. Klasteris auga, kol nebėra daugiau taškų pridėti.

Procesą kartoja tol, kol visi taškai yra arba paskirstyti į klasterį, arba pažymėti kaip triukšmas (taškai, kurie nepriklauso jokiai grupei).

DBSCAN praktikoje: klientų segmentacija

Tarkime, turite 5000 klientų su informacija apie jų pirkimus per pastaruosius 12 mėnesių. Kiekvienas klientas turi du skaičius: vidutinę pirkimo sumą ir pirkimų dažnumą per mėnesį. Šita duomenys sudarą du dimensijas – galite juos pavaizduoti XY grafike.

DBSCAN randa grupes, kurias žmogaus akis matytų grafike. Gali rasti 4 aiškias grupes: didelės sumos, dažni pirkėjai; maži pirkimai, retai; vidutiniai klientai su stabiliais pirkimais; ir izoliuoti taškai (triukšmas) – gal tai boti ar klaidos duomenyse.

Svarbiausia – jūs nenustatėte iš anksto, kad bus keturios grupės. DBSCAN jas rado natūraliai. Šitaip galite suprasti tikrąją jūsų klientų struktūrą, o ne tik išdalinti juos į sąmatytą skaičių kategorijų.

Verslo analitikė žiūri į klasterizavimo rezultatus monitoriuje su skirtingomis spalvotomis grupėmis
Ekrane matomas kodas su DBSCAN parametrais ir biblioteka scikit-learn

Svarbiausi DBSCAN parametrai

DBSCAN naudoja tik du pagrindinius parametrus. Tai lengva, bet reikalinga suprasti, ką jie daro.

eps (ε)

Maksimalus atstumas tarp dviejų taškų, kad būtų laikomi kaimynais. Jei eps per mažas, taškai nebus sujungti į grupes. Jei per didelis, viskas susilies į vieną klasterį. Reikalinga eksperimentuoti.

min_samples

Minimalus taškų skaičius aplinkoje, reikalingas, kad taškas būtų laikomas klasterio branduoliu. Dažniausiai nustatoma 3 arba 5. Didelės duomenų aibės gali reikalauti didesnės reikšmės.

Šitie parametrai yra jūsų kontrolė. Keisdami jus, keičiate tai, ką algoritmas mato kaip „grupę". Nėra teisingos arba klaidingos vertės – viskas priklauso nuo jūsų duomenų ir tikslų.

Informacinis perspėjimas

Šis straipsnis yra edukacinis ir skirtas supažindinti jus su DBSCAN algoritmo principais. Jis nėra pakaitalas verslo konsultacijai ar specialistų nuomonei. Prieš diegiant šiuos metodus jūsų versle, rekomenduojame pasikonsultuoti su duomenų analitiku ar mašininio mokymosi specialistu, kurie galėtų įvertinti jūsų konkrečius poreikius ir duomenis.

Pagrindinis dalykas

DBSCAN yra galingas įrankis klientų segmentacijai, kai nežinote, kiek segmentų reikalinga. Skirtingai nuo K-Means, jis pats atrado grupes pagal duomenis. Tai ypač naudinga didelėms duomenų aibėms ir situacijose, kur segmentų skaičius nėra iš anksto žinomas.

Pradėti naudoti DBSCAN nesudėtinga – pagrindinės bibliotekos kaip scikit-learn turi jau parengtas funkcijas. Svarbiausia – suprasti eps ir min_samples parametrus, nes jie kontroliuoja tai, kaip algoritmas matyti jūsų duomenis.

Kitas straipsniai šioje kategorijoje gali padėti jums giliau suprasti klasterizavimo konceptus. Rekomenduojame perskaityti apie K-Means algoritmo teorijas ir hierarchinę klasterizaciją, kad turėtumėte pilną vaizdą apie segmentacijos galimybes.

Susiję straipsniai

Analitiker dirba su K-Means algoritmo rezultatais prie darbo stalo

K-Means Algoritmas: Nuo Teorijos iki Praktikos

Išmokite, kaip K-Means algoritmas padeda padalyti klientus į grupes pagal jų elgesį ir pirkimo šablonus.

Skaityti straipsnį
Spalvingos klasterizacijos vizualizacijos dendrogramoje

Hierarchinė Klasterizacija: Medžio Struktūra Duomenims

Hierarchinė klasterizacija leidžia suprasti klientų ryšius keliais lygiais ir susikurti detalizuotą grupavimo medį.

Skaityti straipsnį
Mokymo sesija su instruktoriumi ir grupe žmonių aplinkinėje nuotraukoje

Klientų Segmentacija: Iš Duomenų Rinkimo iki Veiksmų Planavimo

Praktinis žingsnis po žingsnio vadovas, kaip iš klasterizavimo rezultatų sukurti veiksmingą verslo strategiją.

Skaityti straipsnį