About this role
À propos de Mila
Fondé par le professeur Yoshua Bengio de l’Université de Montréal, Mila rassemble des chercheurs spécialisés en intelligence artificielle et plus précisément en apprentissage automatique, apprentissage profond et apprentissage par renforcement. Reconnu mondialement pour ses importantes contributions au domaine de l’apprentissage profond, Mila s’est particulièrement distingué dans la modélisation du langage, la traduction automatique, la reconnaissance d’objets et les modèles génératifs. Depuis 2017, Mila est le fruit d’une collaboration entre l’Université de Montréal et l’Université McGill, en lien étroit avec Polytechnique Montréal et HEC Montréal.
Mila s’est donné pour mission d’être un pôle mondial d’avancées scientifiques qui inspire l’innovation et l’essor de l’intelligence artificielle (IA) au bénéfice de tous.
Pour en connaitre davantage, veuillez consulter https://mila.quebec/
Sommaire du poste
Le Lab d'IA souveraine est une nouvelle initiative de Mila visant à assembler une pile (un stack) d'inférence IA open source prête pour l'entreprise, que les organisations peuvent déployer et exploiter sur des infrastructures sous leur contrôle. Elle combine le service de modèles, la recherche d'information (RAG), l'orchestration d'agents et l'observabilité, avec un plan de contrôle pour les gérer comme un produit unique.
Sous la responsabilité du directeur principal de l'ingénierie logicielle, vous concevrez et maintiendrez les paquets de déploiement et l'automatisation de la pile d'IA. Ceux-ci permettront aux partenaires de déployer, mettre à jour et restaurer la pile sur leur propre infrastructure, depuis un nœud unique jusqu'à des grappes Kubernetes en production. Vous travaillerez avec l'équipe d'intégration pour paqueter leurs composants et les déployer dans des environnements de référence à l'aide de flux de travail partagés. Vous recommandez des technologies de plateforme sur la base de tests reproductibles, d'exigences opérationnelles et de la pertinence de l'architecture. Ce rôle ne comprend pas de support de production ni de garde (on-call).
La réussite de ce rôle signifie que les partenaires peuvent déployer, mettre à jour, restaurer et exploiter la pile de manière autonome dans des environnements pris en charge, à l'aide d'automatismes et de guides d'utilisation (runbooks) vérifiés.
Principales responsabilités
- Évaluer les composants de chaque couche de la pile. Développer une connaissance approfondie de leurs capacités, de leurs limites et de leur adéquation avec l'architecture.
- Tester les composants candidats par des expérimentations, des bancs d'essai reproductibles et des déploiements pilotes. Documenter les méthodes et les résultats pour appuyer les décisions techniques.
- Collaborer avec le responsable technique pour recommander des composants et des approches d'intégration basés sur les résultats de tests, les besoins du projet et les exigences opérationnelles.
- Intégrer les composants sélectionnés en production via de la configuration et des tests d'interopérabilité. Effectuer à l'occasion des contributions en amont (upstream) ou rédiger de petits conteneurs d'accompagnement (sidecars) d'intégration au besoin.
- Concevoir et maintenir les flux de travail CI pour tester l'intégration des composants. Automatiser la configuration, le déploiement, les mises à jour et la restauration à l'aide de flux de travail de livraison partagés.
- S'assurer que les composants attribués respectent les exigences de sécurité, d'observabilité et du plan de contrôle.
- Soutenir les déploiements pilotes, diagnostiquer les pannes et améliorer la fiabilité, les performances et l'efficacité des ressources. Travailler avec l'ingénieur·e plateforme sur les modifications d'infrastructure nécessaires.
- Maintenir la documentation d'intégration, les enregistrements de bancs d'essai, les guides d'utilisation (runbooks) et les instructions d'exploitation afin que les ingénieurs et les organisations pilotes puissent déployer et exploiter les composants de manière autonome.
(English Version)
About Mila
Founded by Professor Yoshua Bengio of the Université de Montréal, Mila brings together researchers specializing in artificial intelligence, and more specifically in machine learning, deep learning and reinforcement learning. Recognized worldwide for its important contributions to the field of deep learning, Mila has particularly distinguished itself in language modeling, machine translation, object recognition and generative models. Since 2017, Mila has been the fruit of a collaboration between Université de Montréal and McGill University, with close links to Polytechnique Montréal and HEC Montréal.
Mila's mission is to be a global hub of scientific advances that inspires innovation and the rise of artificial intelligence (AI) for the benefit of all.
To find out more, please visit https://mila.quebec/
Position Summary
The Sovereign AI Lab is a new Mila initiative to assemble an enterprise-ready, open-source AI inference stack that organizations can deploy and operate on infrastructure they control. It combines model serving, retrieval, agent orchestration, and observability, with a control plane to operate them as one product.
Reporting to the Senior Director of Engineering, you will build and maintain deployment packages and automation for the stack. They will enable partners to deploy, upgrade, and roll back the stack on their own infrastructure, from a single node to production Kubernetes clusters. You will work with the integration team to package their components and deploy them to reference environments through shared workflows. You will recommend platform technologies based on reproducible tests, operational requirements, and architecture fit. This role does not include production support or on-call duty.
Success means partners can deploy, upgrade, roll back, and operate the stack independently in supported environments, using verified automation and runbooks.
Main Responsibilities
- Evaluate components in any stack layer. Develop deep knowledge of their capabilities, limitations, and fit with the architecture.
- Test candidate components through experiments, reproducible benchmarks, and pilot deployments. Record methods and results to support technical decisions.
- Work with the Technical Lead to recommend components and integration approaches based on test results, project needs, and operational requirements.
- Integrate selected components into production through configuration and interoperability testing. Make occasional upstream contributions or write small integration sidecars where needed.
- Build and maintain CI workflows to test component integrations. Automate configuration, deployment, upgrades, and rollback through shared release workflows.
- Ensure assigned components meet security, observability, and control plane requirements.
- Support pilot deployments, diagnose failures, and improve reliability, performance, and resource efficiency. Work with the Platform Engineer on required infrastructure changes.
- Maintain integration documentation, benchmark records, runbooks, and operating instructions so engineers and pilot organizations can deploy and operate components independently.
Requirements
Qualifications requises
- 3 ans ou plus d'expérience dans l'intégration, le déploiement et le dépannage de logiciels de production.
- Expérience pratique de l'intégration et des tests d'au moins un composant d'IA, comme un système de recherche d'information ou de mémoire, un environnement d'exécution d'agents, un serveur ou une passerelle de modèles, un serveur d'outils, ou un registre de modèles ou d'outils.
- Capacité à évaluer des composants non familiers par des tests et des bancs d'essai reproductibles, à évaluer leurs capacités et leurs limites, et à recommander des options en fonction des exigences techniques et opérationnelles.
- Expérience dans l'exploitation et le dépannage de services Linux et d'applications conteneurisées à l'aide de Docker ou d'outils de conteneurisation équivalents.
- Expérience d'intégration de services via des API et de la configuration, incluant l'authentification, les contrôles d'accès et la gestion des secrets.
- Compétences pratiques en scripts Python et Shell pour l'automatisation, les tests et de petites intégrations.
- Expérience dans la création de flux de travail CI pour les tests automatisés d'intégration, de mise à jour, de restauration et de reprise dans des environnements reproductibles.
- Expérience dans le déploiement et l'administration de la suite d'observabilité Grafana LGTM ou équivalente, incluant l'intégration de la télémétrie, le stockage, la rétention, la mise à l'échelle, les tableaux de bord, les alertes et le diagnostic à l'aide de journaux, métriques et traces.
- Capacité à expliquer des compromis techniques et à rédiger une documentation permettant à d'autres équipes de déployer et d'exploiter les composants de manière autonome.
Expérience souhaitable
- Exploitation de composants d'IA en production ou soutien aux déploiements dans des environnements clients ou partenaires.
- Déploiement et dépannage de services sur Kubernetes.
- Intégration de services avec configuration centralisée, surveillance de l'état de santé ou gestion du cycle de vie.
- Collaboration avec la communauté des logiciels open source pour signaler des bogues, résoudre des problèmes ou apporter de petites corrections.
Required Qualifications
- 3+ years of experience integrating, deploying, and troubleshooting production software.
- Hands-on experience integrating and testing at least one AI component, such as a retrieval or memory system, agent runtime, model server or gateway, tool server, or model or tool registry.
- Ability to evaluate unfamiliar components through reproducible tests and benchmarks, assess their capabilities and limitations, and recommend options against technical and operational requirements.
- Experience operating and troubleshooting Linux services and containerized applications using Docker or equivalent container tools.
- Experience integrating services through APIs and configuration, including authentication, access controls, and secrets management.
- Practical Python and shell scripting skills for automation, testing, and small integrations.
- Experience building CI workflows for automated integration, upgrade, rollback, and recovery tests in reproducible environments.
- Experience deploying and administering Grafana LGTM or an equivalent observability stack, including telemetry integration, storage, retention, scaling, dashboards, alerts, and diagnosis using logs, metrics, and traces.
- Ability to explain technical tradeoffs and write documentation that enables other teams to deploy and operate components independently.
Useful Experience
- Operating AI components in production or supporting deployments in customer or partner environments.
- Deploying and troubleshooting services on Kubernetes.
- Integrating services with centralized configuration, health monitoring, or lifecycle management.
- Working with open-source maintainers to report bugs, resolve issues, or contribute small fixes.
Benefits
De bonnes raisons pour travailler à Mila
- L’occasion de contribuer à une mission unique avec un impact important;
- Un programme d’assurance collective complet (maladie, dentaire, invalidité, vie, assurance voyage et garanties complémentaires);
- Un programme d’aide aux employés et à la famille;
- Un accès à un service de télémédecine;
- Une politique de congés annuels offrant une base de 20 jours de vacances dès l’embauche;
- Un régime d’épargne retraite avec contribution de l’employeur minimale de 4%;
- Une généreuse enveloppe flexible vous permettant de personnaliser vos avantages sociaux en fonction de ce qui contribue à votre bien-être. Vous pouvez sélectionner et combiner les options qui correspondent à vos besoins parmi les crédits style de vie, une assurance bonifiée, des journées de vacances supplémentaires et une contribution enrichie au régime de retraite;
- Un horaire flexible, un horaire d’été et une possibilité de télétravail;
- Un milieu de travail au cœur de la Petite Italie, dans le quartier branché Mile-Ex, à proximité des transports en commun;
- Une équipe d’experts de leur domaine, des gens passionnés et passionnants;
- Une ambiance de travail collaborative et inclusive.
Nous voulons vous connaître
À Mila, la diversité nous tient à cœur. Nous valorisons un environnement de travail équitable, ouvert et respectueux des différences. Nous encourageons toute personne souhaitant œuvrer dans un écosystème en progression continue et stimulée à contribuer à l’application et la définition d’une culture saine et inclusive, à postuler.
Veuillez noter que seules les personnes sélectionnées seront contactées.
https://mila.quebec/fr/protection-de-la-vie-privee
Good reasons to work in Mila
- The opportunity to contribute to a unique mission with a major impact;
- A comprehensive group insurance program (health, dental, disability, life, travel and extended benefits);
- An employee and family assistance program;
- Access to a telemedicine service;
- A vacation policy offering a base of 20 days' vacation upon hiring;
- A retirement savings plan with a minimum employer contribution of 4%;
- A generous flexible package allowing you to tailor your benefits to what contributes to your well-being. You can select and combine options to suit your needs, including lifestyle credits, enhanced insurance, extra vacation days and enriched pension contributions;
- Flexible working hours, a summer schedule and the possibility of telecommuting;
- A work environment in the heart of Little Italy, in the trendy Mile-Ex district, close to public transportation;
- A team of passionate experts in their field;
- A collaborative and inclusive work environment.
We want to know you
At Mila, diversity is important to us. We value a work environment that is fair, open and respectful of differences. We encourage anyone who wants to work in an ecosystem that is constantly evolving and stimulated to contribute to the application and definition of a healthy and inclusive culture, to apply.
Please note that only selected candidates will be contacted.
https://mila.quebec/fr/protection-de-la-vie-privee