équivalent en python de la table R

Question

J'ai une liste

[[12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [6, 0], [12, 6], [0, 6], [12, 0], [0, 6], [0, 6], [12, 0], [0, 6], [6, 0], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [0, 6], [0, 6], [12, 6], [6, 0], [6, 0], [12, 6], [12, 0], [12, 0], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 0], [12, 0], [12, 0], [12, 0], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [12, 6], [12, 0], [0, 6], [6, 0], [12, 0], [0, 6], [12, 6], [12, 6], [0, 6], [12, 0], [6, 0], [6, 0], [12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [12, 0], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [0, 6], [12, 0], [12, 6], [0, 6], [0, 6], [12, 0], [0, 6], [12, 6], [6, 0], [12, 6], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [12, 6], [12, 0], [6, 0], [12, 6], [6, 0], [12, 0], [6, 0], [12, 0], [6, 0], [6, 0]]

Je veux compter la fréquence de chaque élément de cette liste. Quelque chose comme

freq[[12,6]] = 40

En R, ceci peut être obtenu avec la fonction table. Y a-t-il quelque chose de similaire dans python3?

Brionius · Accepted Answer

Un objet Counter de la bibliothèque collections fonctionnera comme ça.

from collections import Counter x = [[12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [6, 0], [12, 6], [0, 6], [12, 0], [0, 6], [0, 6], [12, 0], [0, 6], [6, 0], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [0, 6], [0, 6], [12, 6], [6, 0], [6, 0], [12, 6], [12, 0], [12, 0], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 0], [12, 0], [12, 0], [12, 0], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [12, 6], [12, 0], [0, 6], [6, 0], [12, 0], [0, 6], [12, 6], [12, 6], [0, 6], [12, 0], [6, 0], [6, 0], [12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [12, 0], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [0, 6], [12, 0], [12, 6], [0, 6], [0, 6], [12, 0], [0, 6], [12, 6], [6, 0], [12, 6], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [12, 6], [12, 0], [6, 0], [12, 6], [6, 0], [12, 0], [6, 0], [12, 0], [6, 0], [6, 0]] # Since the elements passed to a `Counter` must be hashable, we have to change the lists to tuples. x = [Tuple(element) for element in x] freq = Counter(x) print freq[(12,6)] # Result: 28

Shankar Chavan · Answer

Les pandas ont une fonction intégrée appelée value_counts().

Exemple: si votre DataFrame a une colonne avec les valeurs 0 et 1 et que vous souhaitez compter le total des fréquences pour chacune d’elles, utilisez simplement ceci:

df.colName.value_counts()

andilabs · Answer

import pandas x = [[12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [6, 0], [12, 6], [0, 6], [12, 0], [0, 6], [0, 6], [12, 0], [0, 6], [6, 0], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [0, 6], [0, 6], [12, 6], [6, 0], [6, 0], [12, 6], [12, 0], [12, 0], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 0], [12, 0], [12, 0], [12, 0], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [12, 6], [12, 0], [0, 6], [6, 0], [12, 0], [0, 6], [12, 6], [12, 6], [0, 6], [12, 0], [6, 0], [6, 0], [12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [12, 0], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [0, 6], [12, 0], [12, 6], [0, 6], [0, 6], [12, 0], [0, 6], [12, 6], [6, 0], [12, 6], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [12, 6], [12, 0], [6, 0], [12, 6], [6, 0], [12, 0], [6, 0], [12, 0], [6, 0], [6, 0]] ps = pandas.Series([Tuple(i) for i in x]) counts = ps.value_counts() print counts

vous obtiendrez le résultat comme:

(12, 0) 33 (12, 6) 28 (6, 0) 20 (0, 6) 19

et pour [(12,6)] vous obtiendrez le nombre exact, ici 28

pour en savoir plus sur pandas, qui est un puissant outil d’analyse des données Python, vous pouvez le lire dans la documentation officielle: http://pandas.pydata.org/pandas-docs/stable/

METTRE À JOUR:

Si l'ordre n'a pas d'importance, il suffit d'utiliser trié: ps = pandas.Series([Tuple(sorted(i)) for i in x]) après ce résultat:

(0, 6) 39 (0, 12) 33 (6, 12) 28

thorbjornwolf · Answer

Supposons que vous deviez convertir les données en pandas DataFrame de toute façon, de sorte que vous ayez

L = [[12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [6, 0], [12, 6], [0, 6], [12, 0], [0, 6], [0, 6], [12, 0], [0, 6], [6, 0], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [0, 6], [0, 6], [12, 6], [6, 0], [6, 0], [12, 6], [12, 0], [12, 0], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 0], [12, 0], [12, 0], [12, 0], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [12, 6], [12, 0], [0, 6], [6, 0], [12, 0], [0, 6], [12, 6], [12, 6], [0, 6], [12, 0], [6, 0], [6, 0], [12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [12, 0], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [0, 6], [12, 0], [12, 6], [0, 6], [0, 6], [12, 0], [0, 6], [12, 6], [6, 0], [12, 6], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [12, 6], [12, 0], [6, 0], [12, 6], [6, 0], [12, 0], [6, 0], [12, 0], [6, 0], [6, 0]] df = pd.DataFrame(L, columns=('a', 'b'))

alors vous pouvez faire comme suggéré dans cette réponse , en utilisant groupby.size() :

tab = df.groupby(['a', 'b']).size()

tab se présente comme suit:

In [5]: tab Out[5]: a b 0 6 19 6 0 20 12 0 33 6 28 dtype: int64

et peut facilement être changé en un tableau avec unstack() :

In [6]: tab.unstack() Out[6]: b 0 6 a 0 NaN 19.0 6 20.0 NaN 12 33.0 28.0

Remplissez NaNs et convertissez-le en int à votre rythme!

erickfis · Answer

IMHO, pandas offre une meilleure solution pour ce problème de "tabulation":

Une dimension:

my_tab = pd.crosstab(index = df["feature_you_r_interested_in"], columns="count")

Nombre de proportion:

my_tab/my_tab.sum()

Deux dimensions (avec les totaux):

cross = pd.crosstab(index=df["feat1"], columns=df["feat2"], margins=True) cross

Je suis très reconnaissant pour ce blog:

http://hamelg.blogspot.com.br/2015/11/python-for-data-analysis-part-19_17.html

nachoes · Answer

Vous pouvez probablement faire un compte à 1 dimension avec une compréhension de liste.

L = [[12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [6, 0], [12, 6], [0, 6], [12, 0], [0, 6], [0, 6], [12, 0], [0, 6], [6, 0], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [0, 6], [0, 6], [12, 6], [6, 0], [6, 0], [12, 6], [12, 0], [12, 0], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 0], [12, 0], [12, 0], [12, 0], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [0, 6], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [12, 6], [12, 0], [0, 6], [6, 0], [12, 0], [0, 6], [12, 6], [12, 6], [0, 6], [12, 0], [6, 0], [6, 0], [12, 6], [12, 0], [0, 6], [12, 0], [12, 0], [12, 0], [6, 0], [12, 6], [12, 6], [12, 6], [12, 6], [0, 6], [12, 0], [12, 6], [0, 6], [0, 6], [12, 0], [0, 6], [12, 6], [6, 0], [12, 6], [12, 6], [12, 0], [12, 0], [12, 6], [0, 6], [6, 0], [12, 0], [6, 0], [12, 0], [12, 0], [12, 6], [12, 0], [6, 0], [12, 6], [6, 0], [12, 0], [6, 0], [12, 0], [6, 0], [6, 0]] countey = [Tuple(x) for x in L] freq = {x:countey.count(x) for x in set(countey)} In [2]: %timeit {x:countey.count(x) for x in set(countey)} 100000 loops, best of 3: 15.2 µs per loop In [4]: print(freq) Out[4]: {(0, 6): 19, (6, 0): 20, (12, 0): 33, (12, 6): 28} In [5]: print(freq[(12,6)]) Out[5]: 28