Hierarchical Clustering
Agglomerative
Group 22
Introduction
An unsupervised learning method used to group similar data points.
It builds a tree-like structure called a dendrogram.
No need to specify the number of clusters in advance.
Two main types:
Agglomerative (Bottom-Up)
Divisive (Top-Down)
Widely used in:
Biology (gene analysis)
Marketing (customer segmentation)
Document clustering
How we do Clustering?
Agglomerative Clustering Algorithm
1.Start with each data point as its own cluster
2.Compute distance between clusters
3.Merge closest clusters
4.Update distances
5.Repeat until stopping condition is met
6.Generate dendrogram
How Clusters are Merged?
Single Linkage
Distance between closest points
Complete Linkage
Distance between farthest points
Average Linkage
Average distance between all
points
Centroid Linkage
Distance between their centroids
Advantages and Disadvantages
Pros
Cons
No need to predefine number of clusters
Computationally expensive for large
data
Easy to visualize using dendrogram
Works well for small datasets
Sensitive to noise and outliers
Once merged, clusters cannot be split
Thank you