Comptes, vidéos, commentaires, audiences.
Un seul schéma, prêt pour vos modèles.

infos.broker collecte, structure et documente les données publiques des plateformes sociales et du web : profils, vidéos et leurs fichiers, transcriptions, commentaires et statistiques d'engagement. Livrées en JSONL ou Parquet, prêtes à entraîner votre IA.

dataset / instagram / example_creator
Exemple de livraison · données fictives
—

Tout ce qui entoure une publication, dans un seul dataset.

Chaque objet est relié aux autres par des identifiants stables : un compte, ses vidéos, les commentaires de chaque vidéo, les réponses à chaque commentaire.

Compte

L'identité publique et l'audience du créateur.

usernamedisplay_namebiocategoryis_verifiedfollowersfollowingposts_countexternal_url

Vidéos & médias

Le fichier vidéo, sa miniature, sa piste audio et sa transcription horodatée.

video_filethumbnailduration_sresolutioncaptionhashtagstranscriptlanguage

Commentaires

Les réactions publiques, avec les fils de réponses conservés.

comment_idtextlikesreply_topublished_atlangauthor (pseudonymisé)

Métriques

Les chiffres visibles au moment de la collecte, horodatés.

viewslikescommentssharessavesengagement_ratecollected_at

Prêt à entraîner, pas à nettoyer.

Les données arrivent alignées, dédupliquées et découpées. Votre équipe passe directement au fine-tuning ou à l'évaluation.

Paires multimodales

Vidéo, audio, transcription et légende réunis par échantillon, pour la vision, la parole ou le texte.

Signaux d'engagement

Vues, partages et commentaires associés à chaque contenu : utiles pour le ranking, la recommandation ou la prédiction de performance.

Nettoyage inclus

Déduplication par hash, détection de langue, normalisation du texte, pseudonymisation des auteurs de commentaires.

Splits et shards

Découpage train / validation / test et archives en shards pour un chargement en streaming.

train-00001.jsonl · 1 ligneschéma v2

    
JSONLcorpus, ligne par ligne
Parquetdata lake, colonnes
MP4 + JPGmédias d'origine
Shards .tarstreaming GPU
CSV / SQLanalyse, base

De la source à votre cluster.

Huit étapes, documentées dans chaque livraison, pour que vous sachiez exactement d'où vient chaque ligne.

  1. Source
  2. Collecte
  3. Normalisation
  4. Déduplication
  5. Enrichissement
  6. Validation
  7. Dataset
  8. Livraison
5 Go, 100 Go, 400 Go, 1 To…Volume, fréquence et périmètre sont définis projet par projet.
Parler du projet

Le web est ouvert. Les droits ne le sont pas toujours.

Un dataset utilisable pour entraîner un modèle, c'est aussi un dataset dont vous pouvez justifier l'origine.

Décrivez le dataset dont votre modèle a besoin.

Pas besoin de connaître le schéma exact. Indiquez la source, ce que vous voulez récupérer et l'usage prévu : nous définissons le reste avec vous.

  • Périmètre exact de la collectecomptes, hashtags, domaines
  • Champs et schémadocumentés
  • Période et fréquenceponctuel ou récurrent
  • Volume et format de livraisonGo → To
  • Conditions d'utilisationpar écrit

Pas de tarif artificiel : le prix dépend du volume, de la complexité, des sources et du niveau de préparation.

Votre projet

Données à récupérer

Votre demande est transmise directement à notre équipe. Nous vous répondons par e-mail.

Les questions qu'on nous pose.

Peut-on récupérer les fichiers vidéo eux-mêmes ?

Oui, lorsque leur réutilisation est autorisée pour la finalité du projet. Les fichiers sont livrés à côté des métadonnées, référencés par un chemin et un hash SHA-256.

Les datasets peuvent-ils servir à entraîner un modèle IA ?

C'est l'usage pour lequel ils sont préparés. Les conditions d'entraînement applicables à chaque source sont vérifiées et précisées par écrit avant la livraison.

Les commentaires contiennent-ils des données personnelles ?

Potentiellement. Les auteurs peuvent être pseudonymisés, et le traitement est évalué selon la source, la finalité et le cadre juridique applicable.

Vendez-vous l'accès à des comptes ?

Non. Uniquement des informations publiques dont la collecte et l'utilisation sont permises dans le cadre défini du projet.

Pouvez-vous traiter de très gros volumes ?

Oui, des centaines de Go et au-delà peuvent être étudiés. La faisabilité dépend du périmètre, de la fréquence et des contraintes de la source.