Une révolution silencieuse et un nouvel ouest sauvage chez ComputerVision

Il semblerait qu'il y ait déjà eu une révolution avec la vision par ordinateur. En 2012, des algorithmes basés sur des réseaux de neurones convolutifs ont été déclenchés . À partir de 2014, ils ont atteint la production et à partir de 2016, ils ont tout rempli . Mais, fin 2020, un nouveau cycle a eu lieu. Cette fois pas en 4 ans, mais en un. parlons des transformateurs dans ComputerVision. L'article donnera un aperçu des nouveaux produits apparus au cours de la dernière année. Si cela est plus pratique pour quelqu'un, l'article est disponible sous forme de vidéo sur youtube.

Les transformateurs sont un type de réseaux de neurones créés en 2017. Initialement, ils étaient utilisés pour les traductions :

Mais, comme il s'est avéré, ils ont fonctionné simplement comme un modèle universel de la langue. Et c'est parti. En fait, le fameux GPT-3 est un produit de transformateurs.

ComputerVision?

. , . - , . . , . CV.

DETR

2020. . ? . , DETR (End-to-End Object Detection with Transformers), 2020 . , :

, ReInspect 2015 - , BackBone . - ReInspect Detr. .

, , DETR ( , ). .

, DETR ComputerVision. ? ? :

- , . Deformable DETR.
DETR . . iterdet. - ( - https://paperswithcode.com/sota/panoptic-segmentation-on-coco-panoptic ).

DETR Visual Transformer ( + ) . Feature map backbone:

Visual Transformer , . backbone .

VIT

. ViT:

2020 (). -. . - 16*16. “”, .

, , . ( state-of-art). 14 - .

. FaceBook - Deit. .

- https://paperswithcode.com/paper/going-deeper-with-image-transformers

- . , ~2-3 , . ResNet .

CLIP

. CLIP. . CLIP . , . , - :

, . . :

:

, - :

ResNet50. , 100 .

, /. CLIP . CLIP . . , :

Vision Transformers for Dense Prediction

, , - “Vision Transformers for Dense Prediction”, . Vit/Detr. , .

/, / . State-of-art , RealTime. @AlexeyAB ( Yolov4 ), . , , . - , :

---------------------------------------

. - :

1-2

- / . .

PoseFormer

Pose3D. , , :

3 . CherryLabs ( ) 3 , , . , , . - 3D, :

- . ( ). .

, . / .

TransPose

, . TransPose - :

. . , , :

SWIN

Intel. SWIN Microsoft , RealTime. VIT/Deit, :

, , - https://paperswithcode.com/paper/swin-transformer-hierarchical-vision

LOFTR

. . SIFT/SURF+RANSAK ( + ). SuperGlue- Graph Neural Network ComputerVision. SuperGlue . , LOFTR End-To-End:

, :

, , , . : (Video Transformer Network, ActionBert). MMAction.

. , . , - STARK:

, . . , , . , , . . BBOX + , ,

TransTrack

TransT

.

ReID

, . 20 ReID - .

:

. VIT (1,2):

(1,2):

- OCR . , - :

state-of-art . . - 2 . - .

, . , , :

ComputerVision. , , .

. . , - , 2 . , -

, . . - . / - https://t.me/CVML_team ( https://vk.com/cvml_team ).

, , youtube:

All Articles