Questions d'entretien Ingénieur IA

Par Équipe Personal Job Coach

Les entretiens pour un poste d'ingénieur IA évaluent votre capacité à construire des systèmes prêts pour la production qui intègrent des grands modèles de langage, des pipelines de machine learning et une infrastructure de récupération d'informations. Les recruteurs veulent s'assurer que vous maîtrisez l'ensemble de la chaîne, de la sélection du modèle et de l'ingénierie des prompts jusqu'au déploiement, à la surveillance et aux pratiques d'IA responsable. Ce guide couvre les questions les plus fréquentes et les réponses qui montrent que vous pouvez livrer une IA fonctionnelle en production.

Ce guide répond à 10 questions d'entretien parmi les plus fréquentes pour un poste de Ingénieur IA, notamment « Comment décidez-vous d'utiliser un LLM pré-entraîné directement, de le fine-tuner ou de construire un système RAG ? », « Parlez-moi d'une fois où une fonctionnalité IA que vous avez construite n'a pas fonctionné comme prévu en production. » et « Comment structurez-vous un pipeline d'inférence ML pour une utilisation en production à faible latence ? », chacune avec une réponse modèle et un conseil de recruteur.

Pour des conseils généraux de préparation aux entretiens, consultez notre guide sur les questions d'entretien courantes.

Questions d'entretien courantes pour Ingénieur IA

La décision repose sur les schémas d'accès aux données, les exigences de latence et la nature des connaissances dont le système a besoin. Si la tâche est générative et que le modèle de base possède déjà la connaissance du domaine, l'ingénierie de prompts avec un modèle hébergé comme GPT-4o ou Claude est généralement la voie la plus rapide vers la valeur. Le fine-tuning est pertinent quand vous disposez d'exemples étiquetés de haute qualité du format de sortie exact souhaité, ou quand la latence et le coût nécessitent un modèle plus petit et spécialisé. Le RAG est le bon choix quand le système doit accéder à des informations récentes, propriétaires ou fréquemment mises à jour. En pratique, beaucoup de systèmes de production combinent les trois approches : un modèle fine-tuné pour le ton et le format, la récupération pour les connaissances en temps réel, et une conception de prompt soignée pour les relier.

Conseil recruteur:

Les recruteurs cherchent à savoir si vous pouvez articuler les compromis, pas seulement citer les techniques. Mentionnez la latence, le coût et la fraîcheur des connaissances comme facteurs de décision.

Je commencerais par la couche de récupération. Pour un cas d'usage support, la base de connaissances comprend généralement la documentation produit, les tickets résolus et les documents de politique. Je découperais le contenu soigneusement, en visant des morceaux de 300 à 500 tokens avec chevauchement significatif, et j'embarquerais chaque morceau avec text-embedding-3-large d'OpenAI. Je stockerais les embeddings dans une base vectorielle comme Pinecone ou pgvector, avec des filtres de métadonnées par catégorie et langue. Côté génération, j'utiliserais une approche en deux étapes : récupérer les cinq meilleurs morceaux par similarité cosinus, les re-classer avec un cross-encoder, puis passer les trois meilleurs dans le prompt final. J'ajouterais aussi une étape de classification des requêtes pour traiter directement les FAQ évidentes sans récupération, réduisant latence et coût.

Conseil recruteur:

Mentionnez le re-classement explicitement. La récupération naïve top-k sans re-classement est une lacune courante, et en parler montre une expérience de production réelle.

L'évaluation des systèmes LLM doit se faire à deux niveaux. Le premier est l'évaluation hors ligne sur un ensemble fixe d'entrées et de sorties attendues, que je construis avant de construire la fonctionnalité. Je crée un ensemble de test d'au moins 50 cas représentatifs couvrant les entrées typiques, les cas limites et les modes d'échec connus. Je note les sorties avec des métriques automatisées comme BLEU ou ROUGE pour les tâches extractives, et LLM-as-judge pour la génération ouverte, plus une revue humaine d'un échantillon aléatoire. Le second niveau est l'évaluation en ligne via les signaux utilisateurs : notations, taux de modification, taux d'escalade et abandon de session. J'instrumente ces signaux dès le premier jour car les évaluations hors ligne ne prédisent jamais parfaitement l'expérience utilisateur.

Conseil recruteur:

Mentionnez LLM-as-judge et l'écart entre les évaluations hors ligne et en ligne. Beaucoup de candidats ne décrivent que l'une des deux, ce qui suggère une expérience de production limitée.

L'injection de prompts est l'un des risques les plus sérieux dans tout système où les entrées utilisateurs sont incorporées dans un prompt. Mon approche standard est une défense en couches. Au niveau de l'entrée, je valide et assainis les entrées utilisateurs avant qu'elles n'atteignent le prompt, en signalant les chaînes contenant des patterns d'instruction comme 'ignore les instructions précédentes'. Dans le prompt lui-même, j'utilise un cadrage de rôle strict et des délimiteurs XML pour séparer le contenu système de confiance du contenu utilisateur non fiable. Au niveau de la sortie, j'applique une validation pour détecter les réponses déviantes avant qu'elles n'atteignent l'utilisateur. Pour les applications à risque plus élevé, je réalise aussi des exercices de red-teaming périodiques contre le prompt de production pour identifier de nouveaux vecteurs d'injection.

Conseil recruteur:

Les recruteurs veulent entendre parler de défense en profondeur, pas d'une solution miracle unique. Mentionner le red-teaming signale que vous traitez la sécurité de l'IA comme une pratique continue.

Questions comportementales pour les postes Ingénieur IA

J'ai construit une fonctionnalité de résumé de documents pour un outil interne de gestion des connaissances. Lors des tests, elle produisait des résumés précis et concis. Après le lancement, les utilisateurs ont signalé que les résumés de longs contrats juridiques manquaient des clauses clés. La cause racine était une stratégie de découpage qui scindait les documents aux limites de tokens fixes plutôt qu'aux limites sémantiques comme les titres de sections. J'ai réécrit le découpage pour respecter la structure du document, en utilisant les titres et listes numérotées pour créer des morceaux logiques. Après la correction, le taux de clauses manquantes est passé d'environ 18 % à moins de 3 % des documents. La leçon : la stratégie de découpage est aussi importante que le choix du modèle dans un système RAG.

Conseil recruteur:

Des chiffres précis rendent l'histoire crédible. Les recruteurs écoutent aussi si vous avez diagnostiqué la cause racine avec précision plutôt que d'effectuer un changement vague.

L'équipe produit de mon ancienne entreprise voulait que notre assistant IA réponde aux questions sur les prix des concurrents, en utilisant des informations collectées sur des sites publics. J'avais des préoccupations concernant la précision, car les prix changent fréquemment, et le risque de réputation si l'assistant affirmait avec confiance des chiffres obsolètes. J'ai préparé une courte évaluation des risques couvrant la durée de vie des données, le volume de tickets de support prévisible et le risque juridique dans certains marchés réglementés. L'équipe produit a accepté l'argument de précision mais voulait toujours une sensibilisation aux concurrents. Nous avons convenu d'un compromis : l'assistant reconnaîtrait les questions sur les concurrents et redirigerait vers un humain pour des comparaisons détaillées.

Conseil recruteur:

Montrez que vous vous engagez avec le contexte business, pas seulement le risque technique. Les ingénieurs IA qui ne proposent pas d'alternatives sont plus difficiles à travailler en équipe.

Nous faisions passer toutes les requêtes par GPT-4o et nos dépenses API mensuelles avaient atteint un niveau où l'économie unitaire ne fonctionnait plus au prix cible. J'ai effectué une analyse de classification sur un échantillon de 2 000 requêtes et trouvé qu'environ 60 % étaient des recherches factuelles simples ne nécessitant pas un grand modèle. J'ai introduit une couche de routage qui envoyait les requêtes simples à GPT-4o mini et réservait le modèle complet pour les tâches de raisonnement complexes. J'ai validé le routage contre un ensemble de test étiqueté manuellement avant le déploiement. Le résultat a été une réduction de 54 % des coûts API avec des scores de qualité diminuant de moins de 1 %. La logique de routage est devenue un modèle utilisé dans trois autres fonctionnalités IA du produit.

Conseil recruteur:

L'optimisation des coûts par le routage est une technique connue, mais le détail clé que les recruteurs cherchent est comment vous avez validé que la qualité n'a pas chuté.

Questions techniques pour les candidats Ingénieur IA

La clé est de séparer le prétraitement, l'inférence et le post-traitement en étapes distinctes et indépendamment évolutives. Pour le prétraitement, je maintiens les transformations sans état pour qu'elles s'exécutent en parallèle. Pour l'inférence, j'utilise un framework optimisé comme vLLM ou TGI pour les LLMs, qui gère le batching continu et la réutilisation du KV-cache pour augmenter considérablement le débit. Je quantise aussi les modèles quand c'est possible : passer de FP16 à INT8 avec GPTQ réduit généralement la mémoire de moitié. Je configure des files de requêtes avec des voies prioritaires pour que les requêtes utilisateurs interactives ne soient pas bloquées par les traitements par lots. Enfin, j'ajoute une mise en cache des réponses pour les requêtes déterministes via une couche de cache sémantique, réduisant latence et coût pour les entrées similaires répétées.

Conseil recruteur:

Mentionnez vLLM ou TGI par nom. Les candidats qui décrivent l'infrastructure d'inférence à ce niveau de spécificité sont rares et se démarquent considérablement.

La surveillance LLM diffère de la surveillance ML classique car on ne peut pas se fier à une seule métrique numérique. Je suis quatre catégories de signaux. Premièrement, les métriques d'infrastructure : percentiles de latence (p50, p95, p99), taux d'erreur, nombre de tokens par requête et dépenses API. Deuxièmement, les signaux de qualité des sorties : scores LLM-as-judge automatisés sur un échantillon de sorties de production et retours utilisateurs. Troisièmement, les indicateurs de dérive des données : changements dans la distribution des types de requêtes d'entrée. Quatrièmement, les signaux de sécurité : le taux auquel le filtre de sortie ou la modération de contenu se déclenche, segmenté par catégorie d'entrée. J'envoie tout cela dans un tableau de bord Grafana ou Datadog avec des alertes sur les métriques qui ont historiquement précédé les plaintes des utilisateurs.

Conseil recruteur:

Le cadrage en quatre catégories (infra, qualité, dérive, sécurité) est un fort signal de maturité en production. La plupart des candidats ne mentionnent que la latence et les taux d'erreur.

Je commence par construire soigneusement l'ensemble d'entraînement, car la qualité des données compte plus que la technique de fine-tuning. Je vise au moins 500 exemples de haute qualité dans le format d'instruction que le modèle de base attend, avec une division 90/10 entraînement/évaluation. J'utilise LoRA ou QLoRA pour un fine-tuning efficace en paramètres, ce qui me permet d'affiner un modèle 7B sur un seul A100 sans mises à jour de poids complets. J'exécute le fine-tune avec Axolotl ou le Hugging Face Trainer, en suivant les pertes d'entraînement et d'évaluation par époque pour détecter le sur-apprentissage tôt. Après l'entraînement, j'évalue le checkpoint sur l'ensemble d'évaluation avec des métriques spécifiques à la tâche et compare aux performances du modèle non affiné. Je vérifie aussi que le fine-tuning n'a pas dégradé les refus sur les entrées nuisibles, un effet secondaire courant.

Conseil recruteur:

Mentionner LoRA et la vérification de régression de sécurité démontre une vraie expérience de fine-tuning. Beaucoup de candidats décrivent le concept sans mentionner les modes d'échec pratiques.

Ce que les recruteurs recherchent pour un poste Ingénieur IA

Ce que les recruteurs cherchent vraiment chez les candidats ingénieur IA :

  • Une expérience en production, pas seulement en recherche. Les projets personnels et les notebooks Kaggle ne remplacent pas le fait d'avoir livré et maintenu une fonctionnalité LLM sous charge réelle.
  • Une compréhension de la pile complète. Les candidats solides savent comment la récupération, l'inférence et l'évaluation s'articulent, pas seulement une couche isolée.
  • La conscience des coûts et de la latence. Les systèmes IA qui fonctionnent mais ne sont pas économiquement viables ne survivront pas longtemps dans un produit. Montrez que vous pensez à l'économie unitaire dès le départ.
  • Une pratique de l'IA responsable. La sécurité, les biais et la surveillance ne sont pas des réflexions après coup. Les entreprises posent de plus en plus de questions là-dessus dès le premier tour d'entretien.
  • La curiosité pour le paysage des modèles. Le domaine évolue vite. Les candidats qui peuvent nommer les familles de modèles actuelles et leurs compromis montrent qu'ils restent à jour avec la pratique réelle.

Questions à poser à votre interlocuteur

  • À quoi ressemble l'infrastructure IA actuelle, et quelles sont les lacunes les plus importantes que vous cherchez à combler avec ce recrutement ?
  • Comment gérez-vous la gestion des versions de modèles et les retours arrière quand une nouvelle version dégrade la qualité en production ?
  • Quelle est l'approche actuelle de l'équipe pour évaluer la qualité des sorties LLM, et quelle est la maturité des outils d'évaluation ?
  • Comment les décisions sont-elles prises sur les cas d'usage IA dans lesquels investir versus déprioritiser ?
  • Quelles sont les plus grandes préoccupations en matière d'IA responsable ou de sécurité sur lesquelles l'équipe travaille activement ?

Entraînez-vous sur ces questions avant votre entretien

Le simulateur d'entretien construit une session de pratique autour d'une offre d'emploi spécifique et de votre parcours, pour que vous répétiez les questions les plus susceptibles d'être posées.

Commencer l'entrainement

Gratuit sur votre premier poste suivi.

Métiers similaires

Disponible dans d'autres langues