Size: a a a

Python для анализа данных

2021 February 18

3

3ldar in Python для анализа данных
Ivan Kizimenko
В самой задаче? Или в библиотке
Второе)
источник

IK

Ivan Kizimenko in Python для анализа данных
3ldar
Второе)
На сколько я понял ключевая особенность это работа с событием from -> to

Я  же хочу посмотреть в разрезе целого пути каждого пользователя  с учетом очередности.

Ну и пока я печатал, понял что можно было ее добавить и туда
источник

IK

Ivan Kizimenko in Python для анализа данных
Надо уточку купить
источник

KM

Konstantin Mohov in Python для анализа данных
Ivan Kizimenko
На сколько я понял ключевая особенность это работа с событием from -> to

Я  же хочу посмотреть в разрезе целого пути каждого пользователя  с учетом очередности.

Ну и пока я печатал, понял что можно было ее добавить и туда
а в чем проблема сгруппировать по событиям, потом отсортировать по времени события
источник

KM

Konstantin Mohov in Python для анализа данных
внутри еще можно разделить по уникальным пользователям, чтобы не повторяться
источник

KM

Konstantin Mohov in Python для анализа данных
но вообще цепи маркова именно для этого и были придуманы
источник

IK

Ivan Kizimenko in Python для анализа данных
Konstantin Mohov
а в чем проблема сгруппировать по событиям, потом отсортировать по времени события
Не понял что мне это даст
источник

KM

Konstantin Mohov in Python для анализа данных
Ivan Kizimenko
Не понял что мне это даст
стоп, тогда другой вопрос - как вы без событий собрались анализировать поведение пользователей?
источник

IK

Ivan Kizimenko in Python для анализа данных
Konstantin Mohov
стоп, тогда другой вопрос - как вы без событий собрались анализировать поведение пользователей?
Так они у меня есть и их использую. И граф строил через вышеупомянутую библиотеку.


Я не понял что мне даст группировка по событиям?
Могу посчитать сколько раз оно встречалось, сколько уников было :))
источник

IK

Ivan Kizimenko in Python для анализа данных
или тут имеловсь ввиду для каждого уника собрать массив из последовательности событий?
источник

AB

Anastasia Belokon in Python для анализа данных
Ivan Kizimenko
Я пробую рассмотреть весь путь от конкретного собвтия. Это много сессий, и более того много разных доменов
У них есть Centered step matrix
https://retentioneering.github.io/retentioneering-tools/_build/html/step_matrix.html - можете указать путь от конкретного события. Т.к. событий очень много желательно предварительно как-то сегментировать пользователей и уже на этих группках что-то смотреть
источник

IK

Ivan Kizimenko in Python для анализа данных
Anastasia Belokon
У них есть Centered step matrix
https://retentioneering.github.io/retentioneering-tools/_build/html/step_matrix.html - можете указать путь от конкретного события. Т.к. событий очень много желательно предварительно как-то сегментировать пользователей и уже на этих группках что-то смотреть
тут как раз и проблема в том что событий много. Я думал идти как раз от обратного, чтоб убирать несущественные события и перегруппировывать и
источник

IK

Ivan Kizimenko in Python для анализа данных
и еще думаю можно ли что-то сделать с со временем между событиями, веса что ли раздать. Грубо говоря id зашел на сайт нагенерил событий, в этот же день зашел на второй там нагенерил, потом спустя неделю зашел на первый.
источник

MC

Makha Cloud in Python для анализа данных
Классный канал
https://youtu.be/GPVsHOlRBBI
источник
2021 February 19

A

Alexander in Python для анализа данных
Ребят, в pyspark выходи такая ошибка - invalid call to nullable on unresolved object, tree : 'atribut_name'
Сталкивался кто с похожей?
источник

a

ars0k in Python для анализа данных
Подскажите в какую сторону копать - нужно соединить кучу эксель файлов в один, написал скрипт, но у меня там в файле в колонке телефон тип данных текст, из-за этого при мердже файлов телефон "теряет" символы
import pandas as pd
from os.path import isfile, join
import os
mypath = r'C:\files\excel'
#files_path = [os.listdir(mypath)]
files_path = [os.path.join(mypath,x) for x in os.listdir(mypath)]
# print (files_path)
all_file_frames = []
for x in files_path:
  print('Reading %s'%x)
  tab = pd.read_excel(x)
  all_file_frames.append(tab)
all_frame = pd.concat(all_file_frames,axis=0)
all_frame.to_excel('final_file.xlsx')
источник

SE

Stas Egorov in Python для анализа данных
Добрый день. Кто-нибудь сталкивался с проблемой, не могу добавить таблицу в BigQuery методом load_table_from_json , он ругается и выдает ошибку: User does not have bigquery.jobs.create permission in project
Хотя использую тот же файл credentials и он работает если использовать  pandas_gbq.
источник

A

Andrey Denisov in Python для анализа данных
Stas Egorov
Добрый день. Кто-нибудь сталкивался с проблемой, не могу добавить таблицу в BigQuery методом load_table_from_json , он ругается и выдает ошибку: User does not have bigquery.jobs.create permission in project
Хотя использую тот же файл credentials и он работает если использовать  pandas_gbq.
Правов нет
источник

SE

Stas Egorov in Python для анализа данных
Проверял права, нужно же BigQuery Admin?
Просто не понятно, почему через библиотеку pandas_gbq он создает таблицу используя этот же файл
источник

A

Andrey Denisov in Python для анализа данных
У меня на load_table_from_dataframe такое было, решилось именно правами
источник