Kernel k-Groups via Hartigan's Method
エネルギー統計は、80年代にSz \ 'ekelyによって提唱され、古典力学におけるニュートンの重力ポテンシャルに触発され、分布の等価性に関するモデルフリーの仮説検定を提供します。元の形式では、エネルギー統計はユークリッド空間で定式化されました。最近では、負のタイプのメトリック空間に一般化されました。この論文では、負のタイプの空間におけるエネルギー統計の加重バージョンを使用したクラスタリング問題の定式化を検討します。このアプローチは、関連するカーネル空間で2次制約の2次プログラムにつながり、機械学習におけるグラフ分割問題とカーネルメソッドとの接続を確立することを示します。このような最適化問題の局所解を見つけるために、Hartiganの方法をカーネル空間に拡張したカーネルkグループを提案します。カーネルkグループはスペクトルクラスタリングよりも安価であり、カーネルk平均(ロイドのヒューリスティックに基づく)と同じ計算コストですが、数値結果は、特に高次元でパフォーマンスが向上していることを示しています。さらに、コミュニティの検出におけるカーネルkグループの効率を、科学のいくつかの分野で魅力的なアプリケーションを持つスパース確率ブロックモデルで検証します。
Energy statistics was proposed by Sz\' ekely in the 80's inspired by Newton's gravitational potential in classical mechanics and it provides a model-free hypothesis test for equality of distributions. In its original form, energy statistics was formulated in Euclidean spaces. More recently, it was generalized to metric spaces of negative type. In this paper, we consider a formulation for the clustering problem using a weighted version of energy statistics in spaces of negative type. We show that this approach leads to a quadratically constrained quadratic program in the associated kernel space, establishing connections with graph partitioning problems and kernel methods in machine learning. To find local solutions of such an optimization problem, we propose kernel k-groups, which is an extension of Hartigan's method to kernel spaces. Kernel k-groups is cheaper than spectral clustering and has the same computational cost as kernel k-means (which is based on Lloyd's heuristic) but our numerical results show an improved performance, especially in higher dimensions. Moreover, we verify the efficiency of kernel k-groups in community detection in sparse stochastic block models which has fascinating applications in several areas of science.
updated: Thu Jun 11 2020 19:57:09 GMT+0000 (UTC)
published: Thu Oct 26 2017 18:38:28 GMT+0000 (UTC)
