DRW est une société de négoce diversifiée avec plus de 3 décennies d'expérience, cherchant à intégrer la technologie et des talents exceptionnels. Le spécialiste CHP rejoindra l'équipe IA pour concevoir et gérer une infrastructure GPU dédiée aux charges de travail en IA et apprentissage automatique.
Responsibilities:
- Déployer, maintenir et optimiser l’infrastructure GPU pour des charges de travail d’inférence LLM à grande échelle, incluant le provisionnement, la configuration et le déploiement de flottes de serveurs GPU
- Concevoir et mettre en œuvre des solutions de serving distribuées pour des déploiements de modèles multi-nœuds et multi-GPU
- Gérer des clusters Kubernetes avec support GPU pour des charges de travail LLM et ML
- Configurer l’infrastructure réseau, incluant les load balancers, pare-feu et la communication inter-nœuds pour les clusters GPU
- Mettre en œuvre et optimiser des solutions de stockage pour les poids des modèles et les caches d’inférence
- Diagnostiquer les goulets d’étranglement en matière de performance à tous les niveaux : matériel, pilotes, réseau et couche applicative. Rechercher et évaluer les nouvelles technologies GPU, les frameworks de serving de modèles et les optimisations d’infrastructure
- Collaborer avec les ingénieurs ML pour profiler les performances des modèles et mettre en œuvre des techniques d’accélération de l’inférence. Améliorer la fiabilité via la supervision, les alertes, la planification de capacité et la gestion des incidents