- Isinasaayos ng hierarchical clustering ang datos sa isang istrukturang parang puno na tinatawag na dendrogram, na iniiwasan ang pangangailangang itakda nang maaga ang bilang ng mga cluster.
- Bumubuo ang AGNES ng mga kumpol mula sa ibaba pataas sa pamamagitan ng paulit-ulit na pagsasama, habang hinahati naman ng DIANA ang isang malaking grupo mula sa itaas pababa.
- Sinusuri ang kalidad ng cluster gamit ang mga panloob na sukatan tulad ng Davies-Bouldin Index o mga panlabas na paghahambing sa pamamagitan ng Precision at Recall.
Naranasan mo na bang parang nakatitig ka sa isang bundok ng datos at hindi mo makita ang kagubatan dahil sa mga puno? Dito pumapasok ang clustering. Ito ay karaniwang sining ng pagpapangkat-pangkat ng mga data point batay sa kung gaano sila magkakatulad , tinitiyak na ang mga bagay sa loob ng isang grupo ay magkakaugnay habang ang mga grupo mismo ay nananatiling malayo. Ito ay isang pundasyon ng unsupervised machine learning, ibig sabihin ay nakakahanap ang computer ng mga pattern nang hindi sinasabihan nang maaga kung ano ang hahanapin.
Bagama't maraming paraan para hatiin at hatiin ang datos, medyo espesyal ang hierarchical clustering. Sa halip na pumili lamang ng random na bilang ng mga grupo, lumilikha ito ng isang nested na istraktura na mukhang isang family tree . Sinusubukan mo mang pag-iba-ibahin ang isang stock portfolio o i-segment ang iyong customer base, ang pamamaraang ito ay nagbibigay sa iyo ng isang visual na roadmap kung paano nauugnay ang iyong datos, na nagbibigay-daan sa iyong magpasya kung saan puputulin ang tree upang makuha ang perpektong bilang ng mga cluster.
Ang Pangunahing Lohika ng Hierarchical Clustering

Sa kaibuturan nito, ang hierarchical clustering ay bumubuo ng isang hierarchy ng mga grupo. Ito ay kadalasang kinakatawan ng isang dendrogram , isang parang-punong diagram kung saan ang patayong aksis ay kumakatawan sa distansya o pagkakaiba sa pagitan ng mga kumpol. Kung mas mababa ang sangay, mas magkakatulad ang mga aytem. Ang pamamaraang ito ay lubos na nababaluktot dahil hindi ka nito pinipilit na tukuyin nang maaga ang bilang ng mga kumpol (k) mula sa simula, hindi tulad ng mga algorithm tulad ng K-Means.
AGNES: Ang Pamamaraang Mula sa Ibaba Pataas

Ang AGNES, o Agglomerative Nesting, ang pinakakaraniwang uri ng hierarchical clustering. Nagsisimula ito sa mentalidad na "bawat tao para sa kanyang sarili," kung saan ang bawat indibidwal na data point ay nagsisimula bilang sarili nitong maliit na kumpol . Mula roon, paulit-ulit na pinagsasama ng algorithm ang dalawang pinakamalapit na kumpol hanggang sa ang lahat ay maisama sa isang malaking grupo.
Ang proseso ay karaniwang sumusunod sa mga hakbang na ito: una, ang isang proximity matrix ay kinakalkula gamit ang isang distance metric (tulad ng Euclidean distance). Pagkatapos, ang dalawang pinakakatulad na punto ay pinagdudugtong. Ang matrix ay ina-update upang maipakita ang bagong grupong ito, at ang proseso ay uulitin. Upang gumana ito, kailangan mo ng isang linkage criterion upang magpasya kung paano sukatin ang distansya sa pagitan ng mga grupo:
- Isang Pag-uugnay: Tinitingnan ang pinakamababang distansya sa pagitan ng anumang dalawang punto sa magkaibang kumpol. Maaari itong humantong sa "pagkakabit," kung saan ang mga kumpol ay lumalaki sa mahahabang at manipis na linya.
- Kumpletong Pag-uugnay: Nakatuon sa maximum na distansya sa pagitan ng mga punto, na may posibilidad na lumikha ng mas siksik at pabilog na mga grupo.
- Karaniwang Ugnayan: Kinakalkula ang katamtamang distansya sa pagitan ng lahat ng pares ng mga punto sa dalawang kumpol, na nagbibigay ng balanseng gitnang lugar.
- Pag-uugnay ng Sentroid: Sinusukat ang distansya sa pagitan ng mga sentrong heometriko (centroid) ng mga kumpol, na kadalasang mas matatag laban sa mga outlier.
- Paraan ni Ward: Sa halip na puro distansya, nilalayon nito na bawasan ang kabuuang pagkakaiba-iba sa loob ng kumpol, epektibong pinapanatiling mahigpit at magkakaugnay ang mga kumpol.
DIANA: Ang Istratehiya mula sa Itaas Pababa

Sa kabilang banda, mayroon tayong DIANA (Divisive Analysis). Kung ang AGNES ay tungkol sa pagtatayo ng tore, ang DIANA naman ay tungkol sa pag-ukit ng iskultura . Nagsisimula ito sa isang napakalaking kumpol na naglalaman ng bawat data point at paulit-ulit na hinahati ito sa mas maliliit.
Tinutukoy ng algorithm ang kumpol na may pinakamalaking diyametro (ang mga puntong may pinakakaibang pagkakaiba) at hinahanap ang obserbasyon na may pinakamaraming "splinter"—ang pinakakaiba sa iba. Sinisimulan ng obserbasyong ito ang isang bagong grupo, at ang iba pang mga punto ay muling itinatalaga batay sa kung saang grupo sila mas malapit . Nagpapatuloy ito hanggang sa ang bawat punto ay maihiwalay. Hindi tulad ng AGNES, kailangan mo lamang pumili ng sukatan ng distansya; hindi kinakailangan ang paraan ng pag-uugnay dito.
Pagsukat ng Tagumpay at Kalidad
Dahil walang "tamang" sagot sa unsupervised learning, gumagamit kami ng mga partikular na sukatan upang makita kung ang aming mga cluster ay talagang may katuturan. Karaniwan naming hinahati ang mga ito sa internal at external na pagpapatunay.
Hindi kailangan ng Internal Validation ang mga panlabas na label. Halimbawa, tinitingnan ng Davies-Bouldin Index ang ratio ng within-cluster cohesion sa pagitan ng cluster separation; mas mainam ang mas mababang score. Sinusukat ng Potential of Stress ang kabuuan ng mga squared distance sa mga centroid, bagama't natural itong bumababa habang nagdaragdag ka ng mas maraming cluster. Kabilang sa iba pang sikat na tool ang Elbow Method at Silhouette Analysis upang mahanap ang "sweet spot" para sa bilang ng mga grupo.
Ang External Validation ay ginagamit kapag mayroon kang gold standard o mga label ng eksperto na mapaghahambing. Ang mga sukatan tulad ng Precision, Recall, at ang F-measure ay tinatrato ang resulta ng clustering bilang isang problema sa klasipikasyon. Maaari mo ring gamitin ang Information Theory , gamit ang Entropy at Mutual Information upang makita kung gaano kalaki ang nababawasan na kawalan ng katiyakan kapag inihahambing ang output ng algorithm sa mga kilalang kategorya.
Utility sa Tunay na Mundo: Mula Pananalapi hanggang Agham ng Datos
Hindi lamang ito akademikong teorya. Halimbawa, sa pananalapi, ang clustering ay isang makapangyarihan para sa diversification ng portfolio . Sa pamamagitan ng paggamit ng correlation matrix ng asset returns bilang panukat ng distansya, maaaring lumikha ang mga mamumuhunan ng isang dendrogram upang makita kung aling mga stock ang gumagalaw nang sabay-sabay. Upang tunay na mag-diversify, pipiliin ang mga asset mula sa iba't ibang sanga ng puno, tinitiyak na ang portfolio ay hindi masyadong nalalantad sa iisang risk factor.
Bukod sa pananalapi, ang clustering ay nakakatulong sa segmentasyon ng merkado sa pamamagitan ng pagpapangkat-pangkat ng mga customer na may magkakatulad na gawi sa pagbili, na nagpapahintulot sa mga kumpanya na iayon ang kanilang marketing. Ang susi ay ang pag-eksperimento sa iba't ibang sukatan ng distansya—tulad ng Manhattan o Mahalanobis—at iba't ibang paraan ng linkage upang makita kung alin ang nagpapakita ng mga pinaka-posibleng pattern sa partikular na dataset na sinusuri.
Ang pag-master sa mga hierarchical technique na ito ay nagbibigay-daan para sa isang malalim at istruktural na pag-unawa sa datos, na lumilipat mula sa detalyadong detalye ng mga indibidwal na punto patungo sa malawak na larawan ng mga pandaigdigang kategorya. Sa pamamagitan ng pagbabalanse ng mga aglomerative at divisive na estratehiya at pagpapatunay sa mga resulta sa pamamagitan ng mga panloob at panlabas na sukatan, maaaring baguhin ng isang tao ang hilaw at walang label na ingay tungo sa naaaksyunang, organisadong katalinuhan.

