Compte
L'identité publique et l'audience du créateur.
usernamedisplay_namebiocategoryis_verifiedfollowersfollowingposts_countexternal_urlinfos.broker collecte, structure et documente les données publiques des plateformes sociales et du web : profils, vidéos et leurs fichiers, transcriptions, commentaires et statistiques d'engagement. Livrées en JSONL ou Parquet, prêtes à entraîner votre IA.
Chaque objet est relié aux autres par des identifiants stables : un compte, ses vidéos, les commentaires de chaque vidéo, les réponses à chaque commentaire.
L'identité publique et l'audience du créateur.
usernamedisplay_namebiocategoryis_verifiedfollowersfollowingposts_countexternal_urlLe fichier vidéo, sa miniature, sa piste audio et sa transcription horodatée.
video_filethumbnailduration_sresolutioncaptionhashtagstranscriptlanguageLes réactions publiques, avec les fils de réponses conservés.
comment_idtextlikesreply_topublished_atlangauthor (pseudonymisé)Les chiffres visibles au moment de la collecte, horodatés.
viewslikescommentssharessavesengagement_ratecollected_atLes données arrivent alignées, dédupliquées et découpées. Votre équipe passe directement au fine-tuning ou à l'évaluation.
Vidéo, audio, transcription et légende réunis par échantillon, pour la vision, la parole ou le texte.
Vues, partages et commentaires associés à chaque contenu : utiles pour le ranking, la recommandation ou la prédiction de performance.
Déduplication par hash, détection de langue, normalisation du texte, pseudonymisation des auteurs de commentaires.
Découpage train / validation / test et archives en shards pour un chargement en streaming.
Huit étapes, documentées dans chaque livraison, pour que vous sachiez exactement d'où vient chaque ligne.
Un dataset utilisable pour entraîner un modèle, c'est aussi un dataset dont vous pouvez justifier l'origine.
Nous ne vendons pas d'accès à des comptes, de mots de passe, de cookies d'authentification, ni de contenus privés ou obtenus en contournant un mécanisme de sécurité.
Pas besoin de connaître le schéma exact. Indiquez la source, ce que vous voulez récupérer et l'usage prévu : nous définissons le reste avec vous.
Pas de tarif artificiel : le prix dépend du volume, de la complexité, des sources et du niveau de préparation.
Oui, lorsque leur réutilisation est autorisée pour la finalité du projet. Les fichiers sont livrés à côté des métadonnées, référencés par un chemin et un hash SHA-256.
C'est l'usage pour lequel ils sont préparés. Les conditions d'entraînement applicables à chaque source sont vérifiées et précisées par écrit avant la livraison.
Potentiellement. Les auteurs peuvent être pseudonymisés, et le traitement est évalué selon la source, la finalité et le cadre juridique applicable.
Non. Uniquement des informations publiques dont la collecte et l'utilisation sont permises dans le cadre défini du projet.
Oui, des centaines de Go et au-delà peuvent être étudiés. La faisabilité dépend du périmètre, de la fréquence et des contraintes de la source.