Traiter la donnée e-commerce à grande échelle.
Minea rassemble et exploite des données de boutiques, de produits et de publicités pour l’intelligence e-commerce. Ses pipelines collectent, normalisent et rendent consultables ces données, avec plus d’un million de publicités et des dizaines de milliers de boutiques suivies chaque jour.
Comprendre le projetRéduire les détails
L’architecture
Le système sépare le stockage des fichiers, le référentiel relationnel et les index de recherche. Les traitements lourds s’exécutent en parallèle, tandis que le cache sert la grande majorité des lectures. Le référentiel et la recherche représentent chacun environ 1 To.
Ce que le projet illustre
La collecte multisource, la normalisation, le traitement parallèle et l’accès aux données à grande échelle.
- 140 To
- de fichiers
- ≈ 290 millions
- d’enregistrements
- + 1 million
- de publicités suivies chaque jour
Schéma : les sources sont collectées et normalisées, puis réparties en trois couches distinctes : stockage des fichiers, référentiel relationnel et index de recherche.