- ******* Veuillez trouver la version française ci-dessous *********
Job Description
As a UNIX Systems Administrator, you will be responsible for maintaining the stability, reliability, and performance of enterprise compute and storage environments. You will diagnose and resolve production-impacting incidents, collaborate with multiple infrastructure teams, and support customers by ensuring timely resolution of technical issues.
This role requires strong Linux administration skills, experience with enterprise infrastructure, automation, troubleshooting, and the ability to work effectively within a global distributed team. The successful candidate will contribute to operational excellence through proactive system maintenance, risk mitigation, and continuous improvement initiatives.
Primary Responsibilities
- Diagnose and resolve immediate production-impacting issues within the compute and storage environment.
- Collaborate with infrastructure teams including networking, database administration, and hosted solution teams to resolve outages and determine the appropriate resolution path.
- Work with business-aligned customers to understand the scope, impact, and priorities of production incidents.
- Perform proactive health checks, system hygiene activities, and operational maintenance tasks to maintain production stability and ensure compliance with risk and control requirements.
- Collaborate with engineering teams to test, validate, and certify new hardware and software products.
- Participate in occasional weekend project activities to onboard new UNIX assets supporting growth initiatives and large programs such as new data center deployments.
- Participate in an on-call rotation (approximately one week every 4–6 weeks) and act as a point of contact for production issues.
- Work effectively within a global distributed team environment.
Required Skills & Qualifications
- 2 to 5 years of experience in a similar UNIX/Linux Systems Administration role.
- Strong knowledge and hands-on experience with Linux, preferably Red Hat Enterprise Linux (RHEL) and/or other Linux distributions.
- Strong knowledge and experience with enterprise services (DNS, DHCP, NTP, Kerberos, SSHD, PXE, SFTP, HTTPD, Docker).
- Knowledge of enterprise server hardware platforms (blade servers, rack-mounted servers, standalone servers), networking equipment, routers, and switches.
- Ability to read, understand, and write intermediate to complex scripts using (KSH, Bash, Perl, Python).
- Good understanding and experience with configuration management and automation tools (Red Hat Satellite, Quattor, Puppet, Chef).
- Good knowledge and understanding of infrastructure technologies (Clustering, Virtualization, NAS, NFS, SAN).
- Excellent written and verbal communication skills, with the ability to explain technical problems to non-technical audiences.
- Ability to work effectively within a global distributed team.
Preferred Qualifications
- Experience troubleshooting incidents involving compute resources, network issues, and remote storage environments (SAN, NAS).
- Experience analyzing and diagnosing kernel crashes, core dumps, network packet captures, and identifying root causes.
- Strong networking knowledge (TCP/IP, Layer 2/3 network design, firewalls, switches, routers).
- Experience working in a DevOps environment.
- Knowledge and experience with enterprise server hardware vendors (IBM, Dell, HP).
- Ability to identify performance bottlenecks and tune system parameters to improve throughput.
- Good understanding of enterprise availability concepts (Load Balancing, High Availability, Business Continuity).
TMC is an equal opportunity employer and values diversity. We do not discriminate on the basis of race, religion, color, national origin, gender, sexual orientation, age, marital status, veteran status, or disability status.
Description du poste
En tant qu’Administrateur systèmes UNIX, vous serez responsable de maintenir la stabilité, la fiabilité et la performance des environnements d’entreprise liés aux plateformes de calcul et de stockage. Vous serez chargé de diagnostiquer et de résoudre les incidents ayant un impact sur la production, de collaborer avec différentes équipes d’infrastructure et d’assurer un soutien efficace aux utilisateurs.
Ce rôle nécessite une solide expertise en administration Linux, une expérience des infrastructures d’entreprise, de l’automatisation et du dépannage complexe. Le candidat idéal contribuera à l’excellence opérationnelle grâce à une maintenance proactive, à la réduction des risques et à l’amélioration continue des environnements de production.
Responsabilités principales
- Diagnostiquer et résoudre les problèmes immédiats ayant un impact sur la production dans les environnements de calcul et de stockage.
- Collaborer avec les équipes d’infrastructure, notamment les réseaux, l’administration des bases de données et les solutions hébergées, afin de résoudre les interruptions de service et déterminer la meilleure approche de résolution.
- Travailler avec les clients internes afin de comprendre la portée, l’impact et les priorités des incidents de production.
- Effectuer des tâches proactives de vérification de santé, de maintenance et d’hygiène des systèmes afin d’assurer la stabilité opérationnelle et la conformité aux programmes de risques et de contrôles.
- Collaborer avec les équipes d’ingénierie pour tester, valider et certifier de nouveaux produits matériels et logiciels.
- Participer occasionnellement à des activités de projet durant les fins de semaine afin d’intégrer de nouveaux actifs UNIX dans le cadre de projets de croissance ou de déploiements majeurs tels que de nouveaux centres de données.
- Participer à une rotation de garde (environ une semaine toutes les 4 à 6 semaines) et agir comme personne-ressource pour les incidents de production.
- Collaborer efficacement au sein d’une équipe mondiale distribuée.
Compétences et qualifications requises
- De 2 à 5 ans d’expérience dans un rôle similaire d’administration UNIX/Linux.
- Solide connaissance et expérience pratique de Linux, idéalement Red Hat Enterprise Linux (RHEL) et/ou autres distributions Linux.
- Forte connaissance et expérience avec les services d’entreprise (DNS, DHCP, NTP, Kerberos, SSHD, PXE, SFTP, HTTPD, Docker).
- Connaissance des plateformes matérielles de serveurs d’entreprise (serveurs lames, serveurs rack, serveurs autonomes), ainsi que des équipements réseau, routeurs et commutateurs.
- Capacité à lire, comprendre et écrire des scripts intermédiaires à complexes (KSH, Bash, Perl, Python).
- Bonne compréhension et expérience avec les outils de gestion de configuration et d’automatisation (Red Hat Satellite, Quattor, Puppet, Chef).
- Bonne connaissance des technologies d’infrastructure (Clustering, Virtualisation, NAS, NFS, SAN).
- Excellentes aptitudes en communication écrite et verbale, avec la capacité d’expliquer des problèmes techniques à des interlocuteurs non techniques.
- Capacité à travailler efficacement dans une équipe mondiale distribuée.
Qualifications souhaitées
- Expérience en dépannage d’incidents impliquant les ressources de calcul, les problèmes réseau et les environnements de stockage distant (SAN, NAS).
- Expérience dans l’analyse et le diagnostic de crashs du noyau, core dumps, captures de paquets réseau et identification des causes profondes.
- Solides connaissances réseau (TCP/IP, conception réseau de niveau 2/3, pare-feu, commutateurs, routeurs).
- Expérience dans un environnement DevOps.
- Connaissance des fournisseurs de matériel serveur d’entreprise (IBM, Dell, HP).
- Capacité à identifier les goulots d’étranglement de performance et à ajuster les paramètres système afin d’améliorer le débit.
- Bonne compréhension des concepts de disponibilité d’entreprise (Équilibrage de charge, Haute disponibilité, Continuité des affaires).
TMC est un employeur garantissant l’égalité des chances et valorise la diversité. Nous ne pratiquons aucune discrimination fondée sur l’origine, la religion, la couleur, l’origine nationale, le genre, l’orientation sexuelle, l’âge, la situation matrimoniale, le statut de vétéran ou le handicap.