Size: a a a

2018 March 22

I(

Ilya (deadinamoment) 🇷🇺 in JUG NN
Margarita Smirnova
Это просто нашествие Маргариты )
тут так же? почитать и тд? )))
источник

MS

Margarita Smirnova in JUG NN
В образовательных целях, все верно )
источник
2018 April 04

מא

מיכאל איתן in JUG NN
Коллеги, привет. Есть такая задача - есть полмиллиона записей с пользовательскими данными (имейл, телефон, имя, фамилия, информация о девайсе). Среди этих записей есть около 10000 "плохих" пользователей, которых надо деактивировать и не давать регистрироваться впредь. Плохие пользователи отличаются от хороших тем, что используют похожие имена и фамилии, фейковые адреса почты, подчиняющиеся какой-то логике именования (например, на этой неделе они регистрируются как b1@gmail.com, b2@, b3@, а на следующей как kay1@gmail.com, kay2@, etc.). То есть я своим взглядом почти наверное могу отличить фейка от нормального человека. Вопрос - как это сделать программно? Лезет в голову что-то про ML, потому что это похоже на задачу классификации - есть категории и атрибуты, но нет четких правил принятия решения. Но я в мл ничего не знаю ( может у кого-то есть опыт решения подобных задач? Достаточно будет подсказать, в какую сторону смотреть, на какие книжки, сайты, средства, фреймворки и т.п. И, желательно, чтобы все же на джаве )
источник

ES

Eugene Shulga 🚀 in JUG NN
מיכאל איתן
Коллеги, привет. Есть такая задача - есть полмиллиона записей с пользовательскими данными (имейл, телефон, имя, фамилия, информация о девайсе). Среди этих записей есть около 10000 "плохих" пользователей, которых надо деактивировать и не давать регистрироваться впредь. Плохие пользователи отличаются от хороших тем, что используют похожие имена и фамилии, фейковые адреса почты, подчиняющиеся какой-то логике именования (например, на этой неделе они регистрируются как b1@gmail.com, b2@, b3@, а на следующей как kay1@gmail.com, kay2@, etc.). То есть я своим взглядом почти наверное могу отличить фейка от нормального человека. Вопрос - как это сделать программно? Лезет в голову что-то про ML, потому что это похоже на задачу классификации - есть категории и атрибуты, но нет четких правил принятия решения. Но я в мл ничего не знаю ( может у кого-то есть опыт решения подобных задач? Достаточно будет подсказать, в какую сторону смотреть, на какие книжки, сайты, средства, фреймворки и т.п. И, желательно, чтобы все же на джаве )
Правило формата email’a ограничивается {префикс}{число}@{домен} ?
источник

ES

Eugene Shulga 🚀 in JUG NN
Или есть более сложные варианты?
источник

מא

מיכאל איתן in JUG NN
Емейлы валидные, но несуществующие, вариантов масса, с числами и без, буквенная часть тоже варьируется, так что регекс это не вариант. При этом у хорошего пользователя тоже может быть несуществующий емейл, и банить его не надо )
источник

ES

Eugene Shulga 🚀 in JUG NN
То есть система построена так что фейки не фильтруются?
источник

ES

Eugene Shulga 🚀 in JUG NN
Названные email’ы это боты? Нельзя по капче отфильтровать?
источник

ES

Eugene Shulga 🚀 in JUG NN
Какой критерий фейка?
источник

GT

Grigory Tumakov in JUG NN
либо удалять если email не подтвержден в течении нескольких дней
источник

מא

מיכאל איתן in JUG NN
Фейковые адреса не фильтруются, да. Регистрирует их человек, так что капча не вариант.
источник

ES

Eugene Shulga 🚀 in JUG NN
Это сайт знакомств?
источник

V

Viacheslav Tikhonov in JUG NN
источник

ES

Eugene Shulga 🚀 in JUG NN
Из других способов фильтрации фейков - фейсбук авторизация, смс
источник

מא

מיכאל איתן in JUG NN
Формального критерия нет. Неформальный примерно такой - несуществующий или подозрительно короткий емейл, имя из определенного набора (например, Carl, Jason, Mason, John, Abby, Nicki, etc, имена всегда новые) фамилия или латиноамериканская, или начинается на С или J, но тоже не всегда. Это не сайт знакомств, и вводить новые ограничения на регистрацию (подтверждение почты, обязательная авторизация через соцсети) тоже нельзя.

Важнее вопрос - как распознать записи, удовлетворяющие такому критерию?

За ссылку на курсеру спасибо, но это долгий и понятный путь. Может есть какие-то библиотеки алгоритмов, которые можно подключить, обучить, и дергать программно?
источник

GT

Grigory Tumakov in JUG NN
может есть переводичность регистраций, ip адрес регистрируемого. Если сайт то еще можно прибавить useragent, информация, которую может вытянуть фронтенд(разрешение экрана, доступные api браузера, скорость формирования запроса и.т.п)
источник

מא

מיכאל איתן in JUG NN
Это мобильное приложение
источник

מא

מיכאל איתן in JUG NN
Так что банить по айпи опасно )
источник

GT

Grigory Tumakov in JUG NN
и инфорация об используемой мобилке разная?
источник

מא

מיכאל איתן in JUG NN
Уже реализован бан по девайс айди, но противник делает хард ресет или использует udid faker, так что тоже не помогает )
источник