[論文メモ] Mask2Former for Video Instance Segmentation

論文メモ segmentation

arxiv.orggithub.comMask2Formerを動画に拡張した。著者はMask2Formerと大体同じ。手法 Mask2Formerから3つの変更。 Joint spatio-temporal masked attention Mask2Formerは次元がheightとwidthだったが、そこにtimeの次元を追加した(だけ)。なのでマスク…

2021-12-23

[論文メモ] Masked-attention Mask Transformer for Universal Image Segmentation

論文メモ Panoptic Segmentatiom segmentation Transformer Attention

arxiv.orgpanoptic・instance・semantic segmentation用のMasked-attention Mask Transformer(Mask2Former)を提案。手法 Mask2Formerは3つのコンポーネントから成る。 1) 特徴量を抽出するバックボーン 2) 低解像度の特徴量を高解像にするため徐々にupsampl…

2021-12-21

[論文メモ] GAN-Supervised Dense Visual Alignment

GAN StyleGAN2 論文メモ Congealing CVPR2022

arxiv.orggithub.comCVPR2022 GANを使ったDense Visual Alignmentの学習手法学習済みのGANによるサンプルとそのを生成する潜在変数を操作して得られたサンプルのペア (, )を利用した教師あり学習。このペアデータを使ってネットワークを学習する。画像の空…

2021-12-16

[論文メモ] SELF-ATTENTION DOES NOT NEED O(n^2) MEMORY

Attention 論文メモ

arxiv.orgself-attentionの計算にメモリは必要ないself-attentionはクエリ、長さのキーとバリューをそれぞれ、として次の式で表せる（ただしクエリが1つのとき）。普通に実装するとの計算・保存ためにの計算量とメモリが必要。そしてself-attentionは必要。…

2021-12-14

[論文メモ] TRAINING ROBUST ZERO-SHOT VOICE CONVERSION MODELS WITH SELF-SUPERVISED FEATURES

論文メモ voice conversion

arxiv.org 教師なし学習によるVoice Conversion(VC) modelの学習執筆当時、結果のURL。 trungd.github.ioあくまでメモ。間違っているかもしれない。手法をそれぞれソース・ターゲットの音声、をそれぞれソース・ターゲットの音声特徴(MFCCとか)とする。 …

2021-12-10

[論文メモ] Swin Transformer V2: Scaling Up Capacity and Resolution

ViT 論文メモ Transformer

arxiv.orgSwin Transformerの改良。著者はSwin Transformerとだいたい同じ。言語モデルは大量のパラメータ(530billion)で高いパフォーマンスを出しており、パラメータ数が多いと大体パフォーマンスも改善するのはわかっているが、画像系モデルに関してはせ…

2021-12-07

[論文メモ] Improved Multiscale Vision Transformers for Classification and Detection

Attention 論文メモ Transformer Object Detection ViT

arxiv.orgFAIR Technical reportクラス分類、物体検出、動画の認識のためのMultiscale Vision Transformer(MViT)の改善 MViT 高解像度・低解像度のマルチステージを持つViT。以下の論文で提案(著者はほぼ同じ)。 arxiv.orgPooling Attention(PA)が提案されて…