Data Engineer, Analytics | Ingénieur de données, analytique
Description
Meta is seeking a Data Engineer to join our Analytics Data Engineering team, where you will design and build the data infrastructure that powers decision-making across Meta's family of products. In this role, you will architect scalable data pipelines, define semantic data models, and develop self-service analytics solutions that enable product and business teams to derive actionable insights from large-scale structured and unstructured datasets. You will partner closely with data scientists, product managers, and cross-functional stakeholders to ensure data is accurate, well-governed, and optimized for analytical consumption at Meta's scale. ------- Meta est à la recherche d’un ingénieur de données qui se joindra à son équipe d’ingénierie des données analytiques, au sein de laquelle vous concevrez et construirez l’infrastructure de données qui alimente la prise de décision pour l’ensemble de la famille de produits de Meta. Dans ce rôle, vous concevrez des pipelines de données évolutifs, définirez des modèles de données sémantiques et développerez des solutions d’analyse en libre-service permettant aux équipes produit et commerciales d’extraire des informations exploitables à partir d’ensembles de données structurées et non structurées à grande échelle. Vous travaillerez en étroite collaboration avec les scientifiques des données, les chefs de produit et les parties prenantes interfonctionnelles afin de veiller à ce que les données soient exactes, bien gouvernées et optimisées pour l’analyse à l’échelle de Meta.
Responsibilities
Design and implement scalable ETL and ELT pipelines that extract, transform, and load data from diverse sources into analytical data stores | Concevoir et mettre en œuvre des pipelines ETL et ELT évolutifs permettant d’extraire, de transformer et de charger des données provenant de sources diverses dans des entrepôts de données analytiques. Develop and maintain logical and physical data models that span multiple product use cases and reduce implementation complexity across analytics domains | Élaborer et tenir à jour des modèles de données logiques et physiques qui couvrent de multiples cas d’utilisation de produits et réduisent la complexité de mise en œuvre dans l’ensemble des domaines analytiques Define and enforce data quality frameworks, including validation checks, monitoring, and upstream logging improvements in collaboration with cross-functional partners | Définir et appliquer des cadres de qualité des données, notamment des contrôles de validation, une surveillance et des améliorations de la journalisation en amont, en collaboration avec des partenaires interfonctionnels. Establish and evolve data access, privacy, and security models that align with Meta's privacy requirements and data governance standards | Établir et faire évoluer des modèles d’accès aux données, de confidentialité et de sécurité conformes aux exigences de Meta en matière de confidentialité et à ses normes de gouvernance des données Build generalized data staging solutions and interconnected visualization interfaces that enable self-service exploration across product and business teams | Développer des solutions généralisées de préparation des données et des interfaces de visualisation interconnectées permettant l’exploration en libre-service par les équipes produit et commerciales Contribute to semantic services and metadata frameworks to standardize data definitions and reduce redundant data representations across domains | Contribuer aux services sémantiques et aux cadres de métadonnées afin de standardiser les définitions de données et de réduire les représentations de données redondantes entre les domaines. Write, debug, and optimize complex SQL and programmatic queries against large-scale distributed query engines to solve challenging analytical problems | Rédiger, déboguer et optimiser des requêtes complexes, en SQL ou par programmation, exécutées sur des moteurs de requêtes distribués à grande échelle afin de résoudre des problèmes analytiques ardus Collaborate with data scientists, product managers, and engineering partners to translate business requirements into robust data infrastructure solutions | Collaborer avec les data scientists, les chefs de produit et les partenaires d’ingénierie pour traduire les besoins métier en solutions d’infrastructure de données robustes Identify gaps in data systems and propose organizational standards, policies, and processes that improve overall data governance and metadata management | Identifier les lacunes des systèmes de données et proposer des normes, des politiques et des processus organisationnels qui améliorent la gouvernance globale des données et la gestion des métadonnées. Contribute to integration frameworks by teaching peers on best practices, making targeted enhancements, and improving documentation for shared data infrastructure | Contribuer aux cadres d’intégration en formant ses pairs aux pratiques exemplaires, en apportant des améliorations ciblées et en perfectionnant la documentation de l’infrastructure de données partagée
Qualifications
5+ years of experience in data engineering, including designing and implementing production-grade ETL or ELT pipelines | Plus de 5 ans d’expérience en ingénierie des données, y compris la conception et la mise en œuvre de pipelines ETL ou ELT de niveau production 5+ years of experience in writing and optimizing SQL queries against large-scale, distributed data systems | Plus de 5 ans d’expérience dans la rédaction et l’optimisation de requêtes SQL sur des systèmes de données distribués à grande échelle Experience designing logical and physical data models that support multiple analytical use cases at scale | Expérience en conception de modèles de données logiques et physiques prenant en charge de multiples cas d’utilisation analytiques à grande échelle Experience implementing data quality processes, data access controls, and privacy-compliant data handling practices | Expérience en mise en œuvre de processus de qualité des données, de contrôles d’accès aux données et de pratiques de traitement des données conformes aux exigences en matière de confidentialité Experience coding in Python, Scala, or a comparable language to build maintainable and testable data pipeline solutions | Expérience en programmation Python, Scala ou dans un langage comparable pour créer des solutions de pipelines de données maintenables et testables Experience adhering to and implementing responsible, ethical AI practices (e.g., risk assessment, bias mitigation, quality and accuracy reviews) | Expérience en matière de respect et de mise en œuvre de pratiques d’IA responsables et éthiques (par exemple, évaluation des risques, atténuation des biais, examens de la qualité et de l’exactitude) Experience influencing upstream data quality through improved application logging design or structured instrumentation practices | Expérience dans l’amélioration de la qualité des données en amont grâce à une meilleure conception de la journalisation applicative ou à des pratiques d’instrumentation structurées Experience building self-service analytics platforms or interconnected dashboard ecosystems that enable non-technical stakeholders to explore complex datasets | Expérience dans la création de plateformes d’analyse en libre-service ou d’écosystèmes de tableaux de bord interconnectés permettant aux parties prenantes non techniques d’explorer des ensembles de données complexes Demonstrated ongoing AI skill development (e.g., prompt/context engineering, agent orchestration) and staying current with emerging AI technologies | Perfectionnement avéré et continu des compétences en IA (par exemple, ingénierie de requête et de contexte, orchestration d’agents) et connaissance à jour des technologies émergentes en IA Experience contributing to or evolving shared data infrastructure frameworks, semantic layers, or metadata management systems across a large organization | Expérience de la contribution au développement ou à l’évolution de cadres d’infrastructure de données partagée, de couches sémantiques ou de systèmes de gestion des métadonnées au sein d’une grande organisation Familiarity with stream processing frameworks (e.g., Apache Spark, Flink, or equivalent) for handling high-volume, real-time data at scale | Connaissance des cadriciels de traitement de flux (par exemple, Apache Spark, Flink ou équivalent) pour la gestion de volumes importants de données en temps réel à grande échelle Demonstrated ability to integrate AI tools to optimize/redesign workflows and drive measurable impact (e.g., efficiency gains, quality improvements) | Capacité avérée à intégrer des outils d’IA pour optimiser ou repenser les flux de travail et produire des retombées mesurables (par exemple, gains d’efficacité, améliorations de la qualité)
Compensation: CA$131,000/year to CA$181,000/year + bonus + equity + benefits