Телеграмм чат группы dlinnlp страница 46

parrot.ru

Рейтинг популярных групп и каналов

В рейтинге участвует:

групп:

каналов:

Виртуальный сервер на SSD - недорого!

Аренда выделенных и виртуальных серверов (VDS/VPS), хостинг, аренда IP-адресов, администрирование, круглосуточная поддержка

qwarta.ru подробнее

Резервное копирование с проверкой на вирусы!!!

Удобный сервис создания резервных копий на любой сервер сети интернет. Отслеживайте изменения, проверяйте на вирусы. Надежно защитите свой бизнес!

go.backupland.com

Выбираете сервер? Любая конфигурация на заказ!

Аренда физических серверов любых конфигураций под любые запросы - 1С бухгалтерия, игровые сервера, нагруженные проекты, интернет-магазины!

qwarta.ru подробнее

Size: a a a

DL in NLP

2929 membersпожаловаться на группу

1
«
…
‹
41
42
43
44
45
46
47
›
…
»

2020 June 18

VirTex: Learning Visual Representations from Textual Annotations
Desai and Johnson [University of Michigan]
arxiv.org/abs/2006.06666v1

TL;DR предобучение для задач CV на задаче image captioning более sample-efficient, чем предобучение на ImageNet-классификации.

Обучали resnet+transformer lm. В качестве задачи выбрали комбинацию forward LM и backward LM, аналогично ELMo. Хотели попробовать MLM тоже, но не умеестились в compute.

Много людей считают, что связывание CV и NLP будет очень активно развиваться в ближайшие пару лет, я с ними согласен.

источник

188619:39пожаловаться #1

источник

183319:39пожаловаться #2

Одной строкой:

1. Релиз AllenNLP 1.0
1. Специализация по NLP от deeplearning.ai
1. Насколько сильнно twitter влияет на цитируемость статьи
1. Релиз PyTorch Lightning ⚡0.8
1. L3AI идёт прямо сейчас, подключайтесь

спасибо @someotherusername за ссылки

Announcing AllenNLP 1.0

The 1.0 version of AllenNLP is the culmination of several months of work from our engineering team. The AllenNLP library has had…

источник

218119:54пожаловаться #3

2020 June 23

Memory Transformer
Burtsev and Sapunov
arxiv.org/abs/2006.11527

Cтатья от iPavlov и Intento в которой экспериентирют с пустыми токенами в трансформерах. По аналогии с SEP токенами, добавляют по 10-30 MEM токенов. Интуиция тут такая, что потенциально туда трансформер может складывать полезную инфоормацию, например какое-то сжатое описание всего текста. В экспериментах с WMT14 en-de смогло докинуть 1 BLEU к ванильному трансформеру в Base версии. Визуализация attention MEM токенов намекает на то, что они действительно хранят глобальный контекст а так же выполняют с ними операции типа чтения, записи и копирования.

В том числе экспериментировали с более сложным подходом в котором key и value использюется эмбеддинги памяти, а не эмбеддинги токенов, но не зашло.

Результаты довольно неожиданные в контексте свежих статей по интерпретации attention, которые показали, что CLS и SEP используются как своеобразные "выключатели" голов. Было бы интересно посмотреть не только на веса attention, но и на нормы аутпутов, как в статье Atteniton Module is Not Only a Weight.

источник

229618:32пожаловаться #4

источник

221318:32пожаловаться #5

источник

224118:32пожаловаться #6

2020 June 26

I am trilled to announce our second post - BERT Distillation with Catalyst.
Distilling BERT models can minimize loss, reduce model sizes, and speed up inferences. Check it out!

Huge thank you to Nikita for this great tutorial.
https://medium.com/pytorch/bert-distillation-with-catalyst-c6f30c985854?source=friends_link&sk=1a28469ac8c0e6e6ad35bd26dfd95dd9

BERT Distillation with Catalyst

How to distill BERT with Catalyst.

источник

32817:25пожаловаться #7

Статьи в одну строчку:

1. arxiv.org/abs/2006.13979 - мультиязычный претренинг а-ля XLM можно успешно использовать для предобучения моделей распознавания речи (twitter)
1. arxiv.org/abs/2006.13484 - тренировка BERT за 54 минуты с помощью больших батчей, LAMB + Nesterov и нового lr schedule
1. arxiv.org/abs/2006.14170 - нецентрализованный differentially private метод тренировки NLP моделей
1. arxiv.org/abs/2006.12005 - GAN для контролируемой генерации текста, который работает плохо, но зато быстро
1. arxiv.org/abs/1901.06436 - латентное графовое представление для машинного перевода

Alexis Conneau

Unsupervised Cross-lingual Representation Learning for Speech Recognition: https://t.co/zyz4Z3mWBV Our self-supervised learning approach learns cross-lingual speech representations by pretraining a single model from the raw waveform in multiple languages.

источник

218019:50пожаловаться #8

2020 June 29

Переслано от Soslan Tabuev

Свежий обзор зоопарка трансформеров от Григория Сапунова на онлайн-конфе GDG DevParty Russia:

https://www.youtube.com/watch?v=KZ9NXYcXVBY

Григорий Сапунов | Transformer Zoo

Плейлист Mobile: https://www.youtube.com/playlist?list=PLGlZ_ld11os_JyZ6xVAWEZ-rnxrLjrGH5
Плейлист Web: https://www.youtube.com/playlist?list=PLGlZ_ld11os-nnB5CG_p6brIUWMGXU5Tr
Плейлист Cloud: https://www.youtube.com/playlist?list=PLGlZ_ld11os8QYBOSM8KU3INh244iFXKK

Григорий Сапунов — CTO, Intento, Москва, Россия

Transformer Zoo

Новая архитектура нейросетей Трансформер появилась несколько лет назад и продемонстрировала за это время впечатляющие результаты при решении разных полезных задач. В докладе я расскажу, чем эта архитектура отличается от других традиционных архитектур и какие её вариации появились за последнее время.

Слайды: https://docs.google.com/presentation/d/1N7ayCRqgsFO7TqSjN4OWW-dMOQPT5DZcHXsZvw8-6FU/edit?usp=sharing

Twitter спикера: https://twitter.com/HelloIntento

Сайт конференции: https://gdg-devparty.ru
FB GDG Russia: https://www.facebook.com/russia.gdg
VK GDG Russia: https://vk.com/gdgrussia
Telegram GDG Russia: https://t.me/gdgrussia
GDG: https://developers.google.com/community/gdg
DSC:…

источник

199216:03пожаловаться #9

Статьи в одну строчку #2

1. Большой обзор + сравнение различных графовых эмбеддингов. Рассмотрены различные модели (~19), методы сэмплирования, лосс-функции и другие гиперпараметры. Все эксперименты заняли 21,246 GPU часов 😮 (тык)
1. Дифференцируемый (soft) KNN на замену softmax. В том числе на заменту softmax в attention. Модель аутперформит трансформер на 0.8 BLEU на WMT16 en-de (тык).
1. Pre-training via paraphasing. Пусть вам дан текст X, ранжировщик нашёл вам тексты Y1, Y2, ..., YN (возможно, даже на другиих языках). Модель тренируется восстанавливать текст X по Y1, .., YN. Аутперфомит MLM на мультиязычных тасках. (тык)

источник

208516:58пожаловаться #10

2020 June 30

Большой релиз 🤗 Transformers 3.0

Улучшили API токенизаторов, теперь можно токенизировать в numpy-тензоры, padding и truncation теперь нормально работать вместе, исправили проблемы с сохранением-загрузкой 🎉

Обещают, что серьезно подчистили модельки TF (но вы знаете единственный верный способ улучшить модели на TF)

Много улучшений документации, включая примеры использования seq2seq. Кстати в них используют ⚡️, вместо внутреннего Trainer и я тоже очень советую так делать.

Также куча мелких изменений включая бенчмарки, новые модели и примерно 10 млн багфиксов.

Сэкономлю вам немного времени:
pip install transformers --upgrade

Release New tokenizer API, TensorFlow improvements, enhanced documentation & tutorials · huggingface/transformers

New tokenizer API, TensorFlow improvements, enhanced documentation & tutorials
Breaking changes since v2

In #4874 the language modeling BERT has been split in two: BertForMaskedLM and BertLMHe...

источник

230016:15пожаловаться #11

2020 July 02

One little detail about NoamLR

источник

212301:25пожаловаться #12

Тут написали разрабы самой Наташи. У них появилась компактная моделька NER, которая спокойно соревнуется с RuBERT. Думаю много кому будет полезно.

natasha.github.io/ner

"Удалось получить качество на 1 процентный пункт хуже, чем у Deeppavlov BERT NER (F1 PER 0.97, LOC 0.91, ORG 0.85), модель весит в 75 раз меньше (27МБ), работает на CPU в 2 раза быстрее (25 статей/сек) чем BERT NER на GPU. Если коротко, там дистилляция BERT NER в WordCNN-CRF + квантизация + инференс на Numpy."

natasha.github.io

Natasha — качественный компактный NER для русского языка

Извлечение имён, названий топонимов и организаций из новостных статей

источник

287916:57пожаловаться #13

2020 July 04

https://twitter.com/lacker/status/1279136788326432771

Kevin Lacker

GPT-3 can't quite pass a coding phone screen, but it's getting closer.

источник

358008:15пожаловаться #14

2020 July 08

Для любителей книг PyTorch бесплатно раздаёт Deep Learning with PyTorch Antiga, Stevens, and Viehmann.

Я не любитель книг по DL, но решил посмотреть. Короткий обзор:

1. Очень забавный стиль картинок
1. Код без подсветки это ад ада
1. Глава "Why can’t we just throw data at a neural network until it works?" топ
1. Есть глава про деплоймент, к сожалению там Flask, но зато JIT и TorchScript разбирают
1. NLP нет совсем (но пост уже написан, поэтому всё равно опубликую тут)

источник

334017:53пожаловаться #15

2020 July 13

Отличный твит о пяти недооцененных статьях с прошедшего ACL.
тык

Thread about five #acl2020nlp papers that haven’t gotten the hype they deserve:

источник

226510:04пожаловаться #16

2020 July 16

Немножко NLP-полезностей:

1. NYU Deep Learning Course Week 12 про NLP и трансформер (лекция, семинар, заметки)
1. Impoving NLU Through Adversarial Testing (лекция)
1. Ещё одно (слегка упоротое) объяснение трансформера (видео)
1. Официальная иплементация PowerNorm (тык)
1. Новая статья от гугла где учат мапить текстовые команды на UI Android (статья, блогпост)
1. AutoML Zero - эволюция алгоритма обучения с нуля (статья, блогпост, код)

Week 12 – Lecture: Deep Learning for Natural Language Processing (NLP)

Course website: http://bit.ly/pDL-home
Playlist: http://bit.ly/pDL-YouTube
Speaker: Mike Lewis
Week 12: http://bit.ly/pDL-en-12

0:00:00 – Week 12 – Lecture

LECTURE Part A: http://bit.ly/pDL-en-12-1
In this section we discuss the various architectures used in NLP applications, beginning with CNNs, RNNs, and eventually covering the state of-the art architecture, transformers. We then discuss the various modules that comprise transformers and how they make transformers advantageous for NLP tasks. Finally, we discuss tricks that allow transformers to be trained effectively.
0:00:44 – Introduction to deep learning in NLP and language models
0:13:48 – Transformer language model structure and intuition
0:32:55 – Some tricks and facts of Transformer Language Models and decoding Language Models

LECTURE Part B: http://bit.ly/pDL-en-12-2
In this section we introduce beam search as a middle ground between greedy decoding and exhaustive search. We consider the case of wanting to sample from the generative distribution…

источник

234606:01пожаловаться #17

Do Transformers Need Deep Long-Range Memory?
Rae and Razavi [DeepMind]
arxiv.org/abs/2007.03356

Короткий ответ: да
Длинный ответ: экспериментировали с Transformer-XL, смотрели что будет если не все слои будут использовать long-range dependencies. Выяснили, что можно считать длинные зависимости только в 1/6 слоёв, а остальные сделать короткими (128 токенов) и будет работать отлично. Но если убрать длинные зависимости совсем / оставить только один слой, то будет работать плохо.

источник

238816:05пожаловаться #18

источник

290816:05пожаловаться #19

2020 July 24

источник

248906:57пожаловаться #20

1
«
…
‹
41
42
43
44
45
46
47
›
…
»