2 votes

Pandas groupby diff

Mon cadre de données ressemble donc à ceci :

from pandas.compat import StringIO
d = StringIO('''
date,site,country,score
2018-01-01,google,us,100
2018-01-01,google,ch,50
2018-01-02,google,us,70
2018-01-03,google,us,60
2018-01-02,google,ch,10
2018-01-01,fb,us,50
2018-01-02,fb,us,55
2018-01-03,fb,us,100
2018-01-01,fb,es,100
2018-01-02,fb,gb,100
''')

df = pd.read_csv(d, sep=",")

Chaque site a un score différent selon le pays. J'essaie de trouver la différence de score de 1/3/5 jours pour chaque combinaison site/pays.

La sortie devrait être :

date,site,country,score,1_day_diff
2018-01-01,google,ch,50,0
2018-01-02,google,ch,10,-40
2018-01-01,google,us,100,0
2018-01-02,google,us,70,-30
2018-01-03,google,us,60,-10
2018-01-01,fb,es,100,0
2018-01-02,fb,gb,100,0
2018-01-01,fb,us,50,0
2018-01-02,fb,us,55,5
2018-01-03,fb,us,100,45

J'ai d'abord essayé de trier par site/pays/date, puis de regrouper par site et pays, mais je n'arrive pas à comprendre comment obtenir une différence à partir d'un objet groupé.

11voto

ayhan Points 33889

Tout d'abord, il faut trier le DataFrame et ensuite tout ce dont vous avez besoin est groupby.diff() :

df = df.sort_values(by=['site', 'country', 'date'])

df['diff'] = df.groupby(['site', 'country'])['score'].diff().fillna(0)

df
Out: 
         date    site country  score  diff
8  2018-01-01      fb      es    100   0.0
9  2018-01-02      fb      gb    100   0.0
5  2018-01-01      fb      us     50   0.0
6  2018-01-02      fb      us     55   5.0
7  2018-01-03      fb      us    100  45.0
1  2018-01-01  google      ch     50   0.0
4  2018-01-02  google      ch     10 -40.0
0  2018-01-01  google      us    100   0.0
2  2018-01-02  google      us     70 -30.0
3  2018-01-03  google      us     60 -10.0

sort_values ne prend pas en charge les classements arbitraires. Si vous avez besoin de trier arbitrairement (google avant fb par exemple), vous devez les stocker dans une collection et définir votre colonne comme catégorique. Ensuite, sort_values respectera l'ordre que vous avez fourni.

Prograide.com

Prograide est une communauté de développeurs qui cherche à élargir la connaissance de la programmation au-delà de l'anglais.
Pour cela nous avons les plus grands doutes résolus en français et vous pouvez aussi poser vos propres questions ou résoudre celles des autres.

Powered by:

X