Information Distance in Multiples (0905.3347v1)

Published 20 May 2009 in cs.CV and cs.LG

Abstract: Information distance is a parameter-free similarity measure based on compression, used in pattern recognition, data mining, phylogeny, clustering, and classification. The notion of information distance is extended from pairs to multiples (finite lists). We study maximal overlap, metricity, universality, minimal overlap, additivity, and normalized information distance in multiples. We use the theoretical notion of Kolmogorov complexity which for practical purposes is approximated by the length of the compressed version of the file involved, using a real-world compression program. {\em Index Terms}-- Information distance, multiples, pattern recognition, data mining, similarity, Kolmogorov complexity

Citations (38)

View on Semantic Scholar

Summary

We haven't generated a summary for this paper yet.

Summarize Now

Related Papers

Generalized Compression Dictionary Distance as Universal Similarity Measure (2014)
Normalized Information Distance is Not Semicomputable (2010)
Information Distance (2010)
Nonapproximablity of the Normalized Information Distance (2009)
Normalized Information Distance (2008)