RSR Canada

ingénieur de fiabilité de site/site reliability engineer

Publié le 6 juil. 2026
Lieu
Montreal
h/semaine
40 heures/semaine

En tant que membre de l’équipe RELIABILITY & PROD ENGINEERING (RPE), vous devrez mettre votre passion pour la technologie au service de l’équipe afin de lui permettre d’opérer plus efficacement dans un environnement en évolution rapide. Vous nous aiderez à fournir des services de premier ordre aux clients de la firme à travers les différentes unités d’affaires, en vous concentrant sur l’amélioration de la gestion de la production, de la disponibilité des services système, de l’observabilité, de la scalabilité, de la performance et de la résilience, et ce, en appliquant des principes rigoureux de supervision et d’ingénierie logicielle/fiabilité tout en adoptant les technologies et outils les plus récents.

Vos responsabilités comprendront, sans s'y limiter :

Collaborer étroitement avec les équipes d’ingénierie et de développement pour concevoir, construire et maintenir les systèmes.

Dépanner les incidents sur l’ensemble de la pile technologique : matériel, logiciels, applications et réseau.

Identifier et piloter les opportunités d’amélioration de l’automatisation de nos plateformes ; définir le périmètre et créer des solutions d’automatisation pour le déploiement, la gestion et la visibilité de nos services.

Identifier et traiter de manière proactive les risques liés à la fiabilité des systèmes.

Travailler aux côtés des membres actuels des équipes mondiales et régionales selon un modèle de suivi du soleil (follow-the-sun).

Représenter l’organisation RPE lors des revues de conception et des exercices de préparation opérationnelle pour les services nouveaux et existants.

Compétences clés requises au quotidien :

Diplôme de baccalauréat (ou licence) en informatique ou dans un domaine connexe ;

Maîtrise de l'environnement Linux ;

Forte expérience en scripting de bases de données (procédures stockées et requêtes SQL complexes) et en analyse de données avec PostgreSQL, DB2, Snowflake ou MongoDB, etc. ;

Supervision et optimisation des performances des bases de données ;

Expérience pratique du scripting en Python et Shell ;

Excellentes capacités de dépannage (suivi des tendances, production de métriques et analyses) ;

Solides compétences en communication verbale et écrite pour interagir avec des équipes mondiales et des clients ;

Flexibilité pour travailler en horaires décalés (shifts) et assurer des responsabilités d’astreinte ;

Présence au bureau (la politique actuelle exige un minimum de 3 jours par semaine).

Atouts (Sont un plus) :

Expérience dans le secteur des services/produits financiers ou de la banque d’investissement ;

Expérience avec les outils avancés de supervision et d’alerte (Grafana, Loki, Prometheus, Elasticsearch, etc.) ;

Connaissance des outils de développement tels que Git/GitHub, Jenkins, etc. ;

Mentalité et/ou maîtrise des outils Agile / DevOps / SRE ;

Compréhension des technologies Cloud.

_______________________________________________________________________________________________________________________________

As a member of the RELIABILITY & PROD ENGINEERING team we need you to bring your passion for technology to enable the team to operate more efficiently in a fast-paced environment, and to help us provide best in class services to the firm's clients across Business Units, focusing on improving production management, system service availability, observability, scalability, performance, and resilience by applying sound monitoring, software/reliability engineering principles and adopting the latest technology and tooling. Your responsibilities will include, but not be limited to:Working closely with engineering/development teams to design, build, and maintain systems.

Troubleshooting issues across the entire technology stack: hardware, software, application, and network.

Identifying and driving opportunities to improve automation for our platforms; scope and create automation for deployment, management, and visibility of our services.

Proactively identifying and addressing systems reliability risks.

Working alongside existing global and regional team members on a follow-the-sun basis.

Represent the RPE organization in design reviews and operational readiness exercises for new and existing services.

The below are the key skill sets to perform day to day work:

Bachelor's degree in computer science or related field;

Proficiency with Linux;

Strong experience in Database scripting (stored procedure and compound SQL) and data analysis in PostgreSQL, DB2, Snowflake or MongoDB etc.;

DB monitoring and performance tuning;

Working experience in Python/Shell scripting;

Troubleshooting skills (tracking trends, producing metrics and analysis);

Strong verbal and written skills required to interact with global teams and customers;

Flexibility of work in shift and perform on-call responsibility;

Working from office (3 days per week minimum is the current policy).

Good to Have:

Experience in financial service/products, investment banking;

Experience in Advanced Monitoring/Alerting Tools (Grafana, Loki, Prometheus, Elastic Search etc.);

Have knowledge on development tools like Git/GitHub, Jenkins etc.;

Agile/DevOps/SRE mindset and/or tooling;

Understanding Cloud technology.

Projets similaires

+ Voir tous les projets

2026 - Randstad Sourceright GmbH. Tous droits réservés.