L'approche Open Source de Google pour visualiser des ensembles de données volumineux et de grande dimension à l'aide de tSNE

Contenu

Vue d'ensemble

  • Un pasante de Google ha sido pionero en un enfoque que utiliza tSNE para visualizar conjuntos de datos de alta dimension.
  • Cette méthode génère des graphiques plus rapidement que tout autre créé auparavant, Et peut être ouvert dans votre navigateur Web!
  • Il a été créé et open source dans la famille TensorFlow.js

introduction

Traiter des données de grande dimension a toujours été un grand défi pour les data scientists. Vous êtes censé rechercher des fonctionnalités cachées en explorant le vaste terrain du jeu de données (surtout) inconnu, contenant des centaines, oui pas des centaines, de variables. Comment diable commencez-vous?

Pour faire face à cela, L'algorithme tSNE a été créé. Vous avez certainement encore un PCA dont vous pouvez profiter, mais lorsque vous avez un jeu de données MASSIF et que vous souhaitez rechercher un motif dans un style non linéaire (une méthode plus avancée), tSNE s'est avéré plus efficace. Cartographie des ensembles de données multidimensionnels dans deux ou plusieurs dimensions. Il réduit également le nombre de tracés que vous devez générer lorsqu'il s'agit d'un grand nombre de dimensions.

Si vous êtes nouveau sur tSNE ou avez besoin d'une remise à niveau, voir ce guide qui explique en détail ce merveilleux concept.

Mais l'une des limitations de tSNE a été qu'il est très complexe en termes de calcul. Même lorsqu'il est destiné à de grands ensembles de données, cette restriction vous a limité à des ensembles de données relativement petits. Ensuite, un stagiaire de Google a décidé de lancer une approche innovante pour maximiser l'utilisation de tSNE. Sa méthode s'appuie fortement sur le matériel graphique moderne.

Cette nouvelle approche génère des incrustations beaucoup plus rapidement que toute autre technique dans cet espace.. Mais ce qui se démarque vraiment, c'est qu'il peut être exécuté dans un navigateur Web !! Comment demandez-vous? C'est là que TensorFlow.js s'impose. La méthode de Google exploite les capacités du GPU via WebGL, une API JavaScript utilisée pour rendre des graphiques 2D et 3D dans n'importe quel navigateur. Découvrez notre couverture TensorFlow.js ici.

L'équipe, dirigé par un stagiaire, il a ensuite testé son approche sur le populaire jeu de données d'images manuscrites MNIST. Ce que je buvais 15 minutes à calculer peuvent désormais être effectuées en temps réel et dans le navigateur web lui-même. Parler de progrès!

L'image ci-dessus donne un aperçu de cette approche.. je l'ai résumé ci-dessous, tomando un extrait de su trabajo de investigación:

  • Première image: la minimisation de la fonction objectif est calculée en temps linéaire à l'aide d'un champ scalaire
  • Deuxième photo: et un champ vectoriel à deux dimensions
  • Troisième et quatrième images: Les champs sont calculés sur le GPU grâce à la projection de cœurs correctement conçus à l'aide de la fonction de fusion additive du pipeline de rendu moderne. El resto de la reducción al mínimo se trata como una canalización de cálculo de tenseur que se calcula en la GPU a través de TensorFlow.js

J'ai énuméré quelques ressources ci-dessous, Je vous encourage à consulter pour acquérir une compréhension approfondie de cette approche:

Notre avis à ce sujet

Si vous avez déjà traité des ensembles de données de grande dimension, vous êtes peut-être déjà sur la bonne voie pour utiliser cette approche. Cette approche tSNE pourrait changer la donne pour les institutions traitant de grands ensembles de données et n'ayant pas beaucoup de temps libre..

Une des (quelque) ses limites aujourd'hui sont sa capacité à générer uniquement des visualisations 2D (ne fonctionne toujours pas avec la 3D). Mais je ne vois pas cela comme un obstacle, puisque la plupart des visualisations avec lesquelles les scientifiques des données travaillent se trouvent dans l'espace 2D (sauf si vous travaillez avec des données géospatiales).

« Sources libres de Google » c'est devenu une expression très utilisée de nos jours. J'aime qu'ils ouvrent constamment leurs résultats de recherche au profit de la communauté ML au sens large.. Faites-moi savoir ce que vous pensez de cette technique dans la section commentaire ci-dessous..

Abonnez-vous à AVBytes ici pour des mises à jour régulières de la science des données, Machine learning et intelligence artificielle dans votre boîte de réception.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données