wandb.Table pour journaliser des données afin de les visualiser et d’effectuer des requêtes avec W&B. Dans ce guide, découvrez comment :
Créer des Tables
Pour définir une Table, spécifiez les colonnes que vous souhaitez afficher pour chaque ligne de données. Chaque ligne peut correspondre à un élément unique de votre jeu de données d’entraînement, à une étape ou une époque particulière pendant l’entraînement, à une prédiction effectuée par votre modèle sur un élément de test, à un objet généré par votre modèle, etc. Chaque colonne a un type fixe : numérique, texte, booléen, image, vidéo, audio, etc. Vous n’avez pas besoin de spécifier le type à l’avance. Donnez un nom à chaque colonne et veillez à n’insérer dans chaque colonne que des données de ce type. Pour un exemple plus détaillé, voir le guide W&B Table. Utilisez le constructeurwandb.Table de l’une des deux façons suivantes :
-
Liste de lignes :
Journalisez des colonnes nommées et des lignes de données. Par exemple, l’extrait de code suivant génère un tableau avec deux lignes et trois colonnes :
-
Pandas DataFrame : Journalisez un DataFrame avec
wandb.Table(dataframe=my_df). Les noms de colonnes seront extraits du DataFrame.
À partir d’un tableau ou d’un dataframe existants
Ajouter des données
Les Tables sont mutables. À mesure que votre script s’exécute, vous pouvez ajouter plus de données à votre tableau, jusqu’à 200 000 lignes. Il existe deux façons d’ajouter des données à un tableau :- Ajouter une ligne :
table.add_data("3a", "3b", "3c"). Notez que la nouvelle ligne n’est pas représentée sous forme de liste. Si votre ligne est au format liste, utilisez la notation étoile,*, pour développer la liste en arguments positionnels :table.add_data(*my_row_list). La ligne doit contenir le même nombre d’entrées que le tableau comporte de colonnes. - Ajouter une colonne :
table.add_column(name="col_name", data=col_data). Notez que la longueur decol_datadoit être égale au nombre actuel de lignes du tableau. Ici,col_datapeut être une liste ou un tableau NumPy (NDArray).
Ajout incrémentiel de données
Cet exemple de code montre comment créer et alimenter un tableau W&B de manière incrémentielle. Vous définissez le tableau avec des colonnes prédéfinies, y compris les scores de confiance pour toutes les étiquettes possibles, puis vous ajoutez les données ligne par ligne pendant l’Inférence. Vous pouvez également ajouter des données aux tableaux de manière incrémentielle lorsque vous reprenez des runs.Ajout de données à des runs repris
Vous pouvez mettre à jour de façon incrémentielle un tableau W&B dans des runs repris en chargeant un tableau existant depuis un artifact, en récupérant la dernière ligne de données, puis en ajoutant les métriques mises à jour. Réinitialisez ensuite le tableau pour garantir la compatibilité, puis journalisez de nouveau la version mise à jour dans W&B.Récupérer des données
Une fois les données dans une Table, accédez-y par colonne ou par ligne :- Itérateur de lignes : Utilisez l’itérateur de lignes de Table, comme
for ndx, row in table.iterrows(): ..., pour parcourir efficacement les lignes de données. - Obtenir une colonne : Récupérez une colonne de données avec
table.get_column("col_name"). Pour plus de commodité, vous pouvez spécifierconvert_to="numpy"pour convertir la colonne en tableau NumPy (NDArray) de valeurs primitives. Cela est utile si votre colonne contient des types de médias commewandb.Image, afin d’accéder directement aux données sous-jacentes.
Enregistrer des tableaux
Après avoir généré un tableau de données dans votre script, par exemple un tableau de prédictions d’un modèle, enregistrez-le dans W&B pour visualiser les résultats en temps réel.Consigner un tableau dans un run
Utilisezwandb.Run.log() pour enregistrer votre tableau dans le run, comme suit :
Pour enregistrer plus de 200 000 lignes, vous pouvez redéfinir cette limite comme suit :
wandb.Table.MAX_ARTIFACT_ROWS = XCependant, cela entraînera probablement des problèmes de performances, comme des requêtes plus lentes, dans l’UI.Accéder aux Tables de façon programmatique
Côté backend, les Tables sont conservées sous forme d’Artifacts. Si vous souhaitez accéder à une version spécifique, vous pouvez le faire avec l’API des Artifacts :Visualiser les Tables
Tout tableau enregistré de cette façon s’affichera dans votre Workspace, à la fois sur la page du run et sur la page du projet. Pour plus d’informations, voir Visualiser et analyser les Tables.Tableaux d’Artifacts
Utilisezartifact.add() pour journaliser des tableaux dans la section Artifacts de votre run plutôt que dans le Workspace. Cela peut être utile si vous avez un jeu de données que vous souhaitez journaliser une seule fois, puis utiliser comme référence pour de futurs runs.
Joindre des tableaux d’Artifact
Vous pouvez joindre des tableaux créés localement ou des tableaux récupérés depuis d’autres Artifacts à l’aide dewandb.JoinedTable(table_1, table_2, join_key).
Pour joindre deux tableaux que vous avez enregistrés précédemment dans le contexte d’un Artifact, récupérez-les depuis l’Artifact, puis combinez le résultat dans un nouveau tableau.
Par exemple, l’exemple de code suivant montre comment lire un tableau de chansons originales appelé
'original_songs' et un autre tableau contenant des versions synthétisées de ces mêmes chansons appelé 'synth_songs'. Le code joint les deux tableaux sur "song_id" et téléverse le tableau obtenu en tant que nouveau tableau W&B :