Super résolution d'image | Apprentissage en profondeur pour une super résolution d'image

Contenu

introduction

84218sr2-6091428

(RS) est le processus de récupération haute résolution (HEURE) images de basse résolution (G / D) images. Il s'agit d'une classe importante de techniques de traitement d'images dans la vision par ordinateur et le traitement d'images et bénéficie d'un large éventail d'applications dans le monde réel., comme images médicales, images satellites, vigilance et sécurité, images astronomiques, entre autres.

Con el avance en las técnicas de l'apprentissage en profondeur en los últimos años, Les modèles de SR basés sur l'apprentissage en profondeur ont été activement explorés et, souvent, atteindre des performances de pointe dans divers benchmarks SR. Une variété de méthodes d'apprentissage en profondeur ont été appliquées pour résoudre des tâches de RH, allant de la méthode basée sur les réseaux de neurones convolutifs (CNN) aux récentes approches prometteuses de SR basées sur des réseaux génératifs défavorables.

Problème

Le problème de la suppression d'images (RS), en particulier la super-résolution d'une seule image (SISR), a attiré beaucoup d'attention dans la communauté des chercheurs. SISR vise à reconstruire une image haute résolution IRS image unique basse résolution IG / D. Généralement, la relation entre moiG / D et l'image haute résolution d'origine IHEURE peut varier selon la situation. De nombreuses études supposent que jeG / D est une version bicubique réduite de IHEURE, mais d'autres facteurs dégradants comme le flou, la destruction ou le bruit peuvent également être envisagés pour des applications pratiques.

Dans cet article, nous nous concentrerons sur enseignement supervisé méthodes pour les tâches de super-résolution. Lors de l'utilisation d'images HR comme cible et LR comme entrée, on peut traiter ce problème comme un problème d'apprentissage supervisé.

95485supervisé20table-4198838
Tableau complet des sujets en Super Résolution d'Image Supervisée

Méthodes d'échantillonnage supérieures

Avant de comprendre le reste de la théorie derrière la super résolution, nous devons comprendre échantillonnage (Augmenter la résolution spatiale des images ou simplement augmenter le nombre de lignes / colonnes de pixels ou les deux dans l'image) et ses différentes méthodes.

1. Méthodes basées sur l'interpolationInterpolation d'images (mise à l'échelle de l'image) fait référence au redimensionnement des images numériques et est largement utilisé par les applications liées à l'image. Les méthodes traditionnelles incluent l'interpolation du plus proche voisin, interpolation linéaire, binaural, bicubique, etc.

95188interpolation20plus proche20voisins-4410416

Interpolation du plus proche voisin à l'échelle de 2

  • Interpolation du voisin le plus proche – L'interpolation par le plus proche voisin est un algorithme simple et intuitif. Sélectionne la valeur de pixel la plus proche pour chaque position à interpoler indépendamment de tout autre pixel.
  • Interpolation bilinéaire – Interpolation bilinéaire (DEVENIR) effectue d'abord une interpolation linéaire sur un axe de l'image puis sur l'autre axe. Comme il en résulte une interpolation quadratique avec un champ récepteur de 2 × 2, montre de bien meilleures performances que l'interpolation du plus proche voisin, maintenir une vitesse relativement rapide.
  • Interpolation bicubique – de la même manière, interpolation bicubique (BCI) effectue une interpolation cubique sur chacun des deux axes. Par rapport à BLI, le BCI prend en compte 4 × 4 pixels et donne des résultats plus fluides avec moins d'artefacts mais une vitesse beaucoup plus faible. Référer pour ça pour une discussion détaillée.

Carences – Les méthodes basées sur l'interpolation introduisent souvent des effets secondaires comme la complexité de calcul, amplification du bruit, résultats flous, etc.

2. Échantillonnage ascendant basé sur l'apprentissage Pour surmonter les lacunes des méthodes basées sur l'interpolation et apprendre le suréchantillonnage de bout en bout, la couche de convolution transposée et la couche de sous-pixel sont saisies dans le champ SR.

55446suréchantillonnage202-4369552

Couche de convolution transposée: les carrés bleus indiquent l'entrée,
et les cases vertes indiquent le noyau et la sortie de convolution.

  • Convolution transposée: couche, également appelée couche de déconvolution, essayer d'effectuer une transformation opposée à une convolution normale, c'est-à-dire, prédire l'entrée possible en fonction des cartes de caractéristiques de la taille de la sortie de convolution. Spécifiquement, augmente la résolution de l'image en agrandissant l'image en insérant des zéros et en effectuant une convolution.
15959suréchantillonnage203-5778744

Couche de sous-pixels: les cases bleues indiquent l'entrée et les cases avec d'autres couleurs indiquent différentes opérations de convolution et différentes cartes de caractéristiques de sortie.

  • Couche de sous-pixels: La couche de sous-pixels, une autre couche de suréchantillonnage qui peut être apprise de bout en bout, effectue un suréchantillonnage en générant une pluralité de canaux par convolution puis en remodelant les programmes. Au sein de cette couche, une convolution est d'abord appliquée pour produire des sorties avec
    s2 canaux horaires, où s est le facteur d'échelle. En supposant que la taille d'entrée est h × l × c, la taille de sortie sera h × l × s2C. Après cela, l'opération de remise en forme est effectuée pour produire des sorties de taille sh × sw × c

Cadres de superrésolution

Puisque la super-résolution d'image est un problème mal posé, comment suréchantillonner (c'est-à-dire, générer une sortie de fréquence cardiaque à partir de l'entrée LR) est le problème clé. Il existe principalement quatre bases de sondage basées sur les principales opérations d'échantillonnage utilisées et leurs emplacements dans le modèle. (voir le tableau ci-dessus).

1. Super résolution de pré-échantillonnage –

79337pre20upsample-8052999

Nous ne faisons pas de mappage direct des images LR aux images HR car cela est considéré comme une tâche difficile. Utiliser des algorithmes de suréchantillonnage traditionnels pour obtenir des images à plus haute résolution, puis les affiner à l'aide de réseaux de neurones profonds est une solution simple. Par exemple, Les images LR sont échantillonnées en images HR épaisses avec la taille souhaitée par interpolation bicubique. Alors, des CNN profonds sont appliqués à ces images pour reconstruire des images de haute qualité.

2. Super résolution post-échantillon:

13629post-3399813

Pour améliorer l'efficacité de calcul et tirer pleinement parti de la technologie d'apprentissage en profondeur pour augmenter automatiquement la résolution, los investigadores proponen realizar la mayoría de los cálculos en un espacio de baja dimension reemplazando el muestreo predefinido con capas de aprendizaje de extremo a extremo integradas al final de los modelos. Dans le travail pionnier de ce cadre, a savoir, SR post-échantillonnage, Les images d'entrée LR alimentent CNN en profondeur sans augmenter la résolution, et les couches d'échantillonnage supérieures qui peuvent être apprises de bout en bout sont appliquées à la fin du réseau.

Stratégies d'apprentissage

Dans le domaine de la super résolution, les fonctions de perte sont utilisées pour
mesurer l'erreur de reconstruction et guider l'optimisation du modèle. Dans les premiers jours, les chercheurs utilisent généralement Perte L2 par pixel (erreur quadratique moyenne), mais alors il découvre qu'il ne peut pas mesurer le
qualité de reconstruction très précise. Donc, une variété
fonctions de perte (p. ne pas., perte de contenu, les adversairess) sont adoptés pour mieux mesurer la reconstruction
erreur et produire des résultats de meilleure qualité et plus réalistes.

  • Perte de Pixelwise L1 Différence absolue entre les pixels de l'image HR de vérité terrain et celle générée.
  • Perte de Pixelwise L2 – Différence quadratique moyenne entre les pixels de l'image HR de vérité terrain et celle générée.
  • Perte de contenu – la perte de contenu est signalée comme la distance euclidienne entre les rendus de haut niveau de l'image de sortie et l'image cible. Les fonctions de haut niveau sont obtenues en passant par des CNN préalablement formés tels que VGG et ResNet.
  • Perte de l'adversaire Basé sur le GAN, où nous traitons le modèle SR comme un générateur et définissons un discriminateur supplémentaire pour juger si l'image d'entrée est générée ou non.
  • PSNR – Le rapport signal sur bruit de pointe (PSNR) est une métrique objective couramment utilisée pour mesurer la qualité de reconstruction d'une transformation avec perte. PSNR est inversement proportionnel au logarithme de l'erreur quadratique moyenne (MSE) entre l'image réelle du terrain et l'image générée.

En MSE, Je suis un sans bruit métro×Nord image monochrome (vérité fondamentale) et K est l'image générée (approche bruyante). Un PSNR, MAXIMUMje représente la valeur de pixel maximale possible de l'image.

Disposition du réseau

39970network20design-6696597

Diverses conceptions de réseau en architecture super-résolution

Assez de bases! Analysons quelques-uns des État de l'art méthodes de superrésolution –

Méthodes de superrésolution

Réseau d'adversaires génératifs de super-résolution (SRGAN)Utiliser l'idée de GAN pour la tâche de super résolution, c'est-à-dire, le générateur essaiera de produire une image à partir du bruit qui sera jugé par le discriminateur. Ambos seguirán entrenando para que el generador pueda generar imágenes que puedan coincidir con los datos de entraînement reales.

76376gan-1587937

Architecture du réseau d'adversaire génératif

Il existe plusieurs formes de super résolution, Mais il y a un problème: Comment pouvons-nous récupérer des détails de texture plus fins à partir d'une image basse résolution afin que l'image ne soit pas déformée?

Les résultats ont un PSNR élevé; les médias ont des résultats de haute qualité, mais manquent souvent de détails haute fréquence.

Pour y parvenir dans SRGAN, nous utilisons le Fonction de perte perceptiva que comprende la pérdida de contenido y de adversario.

Vérifier la papiers originaux pour des informations détaillées.

Pas –

1. Nous traitons les RH (images haute résolution) pour un échantillonnage réduit des images LR. Nous avons maintenant des images HR et LR pour l'ensemble de données d'entraînement.

2. Nous passons les images LR à travers un générateur qui échantillonne et fournit des images SR.

3. Nous utilisons le discriminateur pour distinguer l'image HR et propager la perte de GAN pour entraîner le discriminateur et le générateur.

84463srgan-5284502

Architecture réseau SRGAN

Principales caractéristiques de la méthode:

  • Type de base de sondage après échantillonnage
  • Couche sous-pixel pour un échantillonnage plus élevé
  • Contient des blocs résiduels
  • Utiliser la perte de perception

Code d'origine SRGAN

EDSR, MDSR – Exposition des techniques d'apprentissage résiduel
performances de super-résolution améliorées grâce à des réseaux de neurones à convolution profonde (DCNN). Architecture à échelle unique Réseau de super-résolution profonde amélioré (EDSR) gère une échelle de super-résolution spécifique et Système de super résolution profonde à plusieurs échelles (MDSR) reconstruit plusieurs échelles d'images haute résolution en un seul modèle. Amélioration significative des performances du modèle.
est due à l'optimisation en supprimant les modules inutiles dans
réseaux résiduels conventionnels.

Vérifier la papiers originaux pour des informations détaillées.

Quelques-unes des principales caractéristiques des méthodes:

  • Blocs résiduels – SRGAN a appliqué avec succès l'architecture ResNet au problème de super-résolution avec SRResNet, des performances encore améliorées grâce à l'utilisation d'un meilleur cadre ResNet. Dans l'architecture proposée –
41351edsr20resnet-1433787

Comparaison des blocs résiduels

  • Quitaron las capas de standardisation por lotes de la red como en SRResNets. Étant donné que les couches de normalisation par lots normalisent les caractéristiques, éliminer la flexibilité de la portée du réseau en standardisant les caractéristiques, il vaut mieux les éliminer.
63540edsr-mdsr-3501217
L'architecture de l'EDSR, MDSR
  • Un MDSR, propusieron una arquitectura multiescala que comparte la mayoría de los paramètres en diferentes escalas. Le modèle multi-échelle proposé utilise beaucoup moins de paramètres que plusieurs modèles à une seule échelle, mais affiche des performances comparables.

Code original des méthodes

Alors maintenant, nous sommes arrivés à la fin du blog!! Pour plus d'informations sur la super résolution, vérifier ces enquêtes sur les emplois.

S'il vous plaît partager vos commentaires sur le blog dans la section des commentaires. Bon apprentissage 🙂

Les médias présentés dans cet article ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données