S
en

Bonjour, je suis

Sadok Aziz Ben Younes

Ingénieur IA & LLM

Je conçois des systèmes intelligents, des agents IA et des logiciels prêts pour la production.

  • Systèmes IA / LLM
  • Architectures multi-agents
  • Systèmes RAG
  • MLOps / LLMOps
  • Ingénierie backend
  • Développement full-stack
Sadok Aziz Ben Younes

Profil

L'ingénierie logicielle et l'IA, traitées comme une seule discipline.

Diplômé de l'ENSI en septembre 2026 en génie informatique. Au fil de trois stages, j'ai construit la même chose sous des formes différentes : un système d'IA qui doit résister au contact d'utilisateurs réels. Un assistant vocal qui répond en temps réel. Un pipeline de vision qui lit un flux de circulation en direct. Des outils d'agent qui permettent à un modèle d'agir sur un agenda et une boîte mail.

Les problèmes intéressants se trouvaient rarement dans le modèle. Ils étaient dans l'orchestration, les modes de défaillance, le coût d'une réponse lente, et la capacité à savoir si une nouvelle version valait réellement mieux que la précédente. C'est ce travail que je veux approfondir.

L'empilement des couches

  1. Ingénierie IA

    Transformer une capacité en composant doté d'un contrat.

  2. LLM

    Prompting, fine-tuning et quantification, choisis selon la contrainte.

  3. Agents

    Des graphes d'étapes spécialisées plutôt qu'un prompt qui fait tout.

  4. Données

    Recherche, pipelines de features et versionnement pour des résultats reproductibles.

  5. Systèmes en production

    Budgets de latence, observabilité, CI, et un chemin de mise en production assumé.

Expérience

Là où ces systèmes ont été construits.

Trois stages, chacun un cran plus haut dans la stack, du modèle vers le produit.

  1. Réalisations clés

    • Développement de Voice Vibe, un plugin d'assistant vocal temps réel. Un prompt unique gérant toute une conversation parlée est lent et impossible à déboguer : je l'ai découpé en six agents LangGraph spécialisés composés en graphe, reliés par un pipeline STT/TTS en WebSocket, chaque étape étant observable pour qu'un mauvais tour de parole se trace jusqu'à un nœud précis.
    • Latence de bout en bout mesurée autour de 975–1020 ms au p50, de la voix entrante à la voix sortante, les six agents s'exécutant à chaque tour.
    • Comparaison de ce résultat avec cinq plateformes vocales de production, afin d'identifier les vrais goulets d'étranglement plutôt que les goulets supposés.
    • Conception d'un pipeline MLOps complet (CRISP-DM) pour un moteur de recommandation d'acceptation de suggestions, avec un feature engineering sans fuite de données et des modèles LightGBM et de régression logistique calibrés, suivis dans MLflow et DVC.
    • Mise en place d'une passerelle de promotion déterministe — shadow, puis gate, puis promote — afin qu'aucune version de modèle n'atteigne la production sans avoir été mesurée.
    • Durcissement du service : défenses contre l'injection de prompt, limitation de débit WebSocket, et une CI GitHub Actions exécutant tests automatisés et audits de dépendances.

    Benchmark de latence Voice Vibe

    SystèmeArchitectureLatence de bout en bout
    OpenAI Realtime / GPT-4o voicenative speech-to-speech< 400 ms
    Retell AIcascade≈ 600 ms
    Vapicascade≈ 700–1500 ms
    Pipecat / LiveKit Agentscascade≈ 750–950 ms
    Voice Vibecascade + multi-agent≈ 975–1020 ms (p50)
    Synthflowcascade≈ 1800 ms
    Latence de bout en bout, de la voix entrante à la voix sortante. Les modèles nativement voix-à-voix suppriment les étapes STT et TTS, ce qui explique qu'ils se situent sous tous les systèmes en cascade présentés ici. Voice Vibe est le seul à exécuter un graphe de six agents à chaque tour de parole.
    • FastAPI
    • LangGraph
    • PostgreSQL
    • LightGBM
    • MLflow
    • DVC
    • Docker
    • GitHub Actions
    • pytest

Travaux sélectionnés

Deux systèmes, du problème jusqu'à la production.

Chacun est présenté comme une étude de cas : le problème réel, ce que j'ai construit, et ce que cela a changé.

Vision par ordinateur · Systèmes temps réel

2025

Surveillance intelligente du trafic

Détection et suivi de véhicules, capture de plaques et estimation de vitesse par homographie.

Problème

Une vitesse mesurée en pixels n'est pas une vitesse, et la détection seule perd un véhicule dès qu'il passe derrière un plus gros. Sans identité entre les images ni correspondance entre la vue caméra et les distances réelles, aucun des chiffres attendus par un exploitant n'est fiable.

Contribution

J'ai construit le pipeline de bout en bout : YOLOv8 détecte les véhicules, ByteTrack conserve leur identité entre les images, un second modèle YOLOv8 repère les plaques dans chaque vignette de véhicule, et une homographie à neuf points convertit les positions en pixels vers des coordonnées réelles, faisant de la vitesse une véritable mesure. Les infractions sont ensuite signalées selon des limites propres à chaque type de véhicule.

FPS soutenus
0FPS soutenus
précision de l'estimation de vitesse
98.6%précision de l'estimation de vitesse
points de calibration homographique
0points de calibration homographique
  • YOLOv8
  • ByteTrack
  • Supervision
  • FastAPI
  • WebSocket
  • Redis
  • Celery
  • Streamlit
  • Prometheus
  • Grafana
  • MLflow
  • Docker
  • pytest

Architecture

Ingestion
  • video upload
  • FastAPI
  • Redis queue
  • Celery workers
Détection
  • YOLOv8 vehicles
  • ByteTrack
Plaques
  • YOLOv8 plate detector
  • quality assessor
  • best-shot storage
Mesure
  • 9-point homography
  • outlier rejection
  • per-class speed limits
Observation
  • Prometheus
  • Grafana
  • MLflow
Restitution
  • Streamlit
  • WebSocket updates

Multimodal · Accessibilité

2025

Sign Bridge

Parole, texte et vidéo traduits en langue des signes par un avatar 3D.

Problème

La langue des signes n'est pas un encodage mot à mot de la parole. Une transcription littérale produit un résultat illisible pour une personne sourde : la traduction doit se faire au niveau du sens.

Contribution

Je l'ai construit en deux systèmes. Un backend FastAPI normalise parole, texte et vidéo en une représentation unique et la convertit en glose signée via une étape NLP fondée sur BERT, Whisper assurant la transcription lorsque l'entrée est parlée. Un client Unity anime ensuite un avatar 3D à partir des points clés dérivés d'OpenPose.

phrases dans le vocabulaire
32kphrases dans le vocabulaire
mots isolés
4kmots isolés
modalités d'entrée
0modalités d'entrée
  • FastAPI
  • Whisper
  • BERT
  • Transformers
  • OpenPose
  • Unity
  • NLTK
  • PostgreSQL
  • Pandas

Architecture

Entrée
  • speech
  • text
  • video
Transcription
  • Whisper STT
Compréhension
  • BERT
  • NLTK
Correspondance
  • sign gloss
  • OpenPose keypoints
Rendu
  • Unity 3D avatar

Approche

Ma façon de construire.

Cinq principes qui résistent au contact de la production.

Architecture

Concevoir des systèmes modulaires aux frontières explicites, pour qu'un composant se remplace sans réécriture et qu'une défaillance reste isolée.

Ingénierie IA

Traiter un modèle de langage comme un composant doté d'un contrat, et non comme une boîte noire que l'on prompte plus fort quand elle dérape.

Performance

Mesurer latence, débit et consommation avant d'optimiser. L'étape la plus lente est rarement celle que l'on soupçonne.

MLOps

Suivre expériences, données et versions de modèles pour qu'un résultat soit reproductible, et conditionner les mises en production pour attraper une régression avant les utilisateurs.

Sécurité

Valider à la frontière, isoler l'exécution, et instrumenter assez pour remarquer ce qui va mal.

Compétences

La stack que j'utilise réellement.

Regroupée par couche du système.

IA / Machine Learning

Graphes d'agents, recherche, transformers et modèles de vision.

  • LangGraph
  • LangChain
  • RAG
  • Multi-Agent Orchestration
  • Transformers
  • BERT
  • PyTorch
  • YOLO
  • OpenCV
  • ByteTrack
  • Mistral
  • DeepSeek
  • Scikit-learn
  • LightGBM

Backend

Services, transports et les bases de données derrière.

  • Python
  • FastAPI
  • Spring Boot
  • Java
  • WebSocket
  • PostgreSQL
  • MySQL
  • DynamoDB
  • Redis
  • Celery

Frontend

Interfaces typées au-dessus des systèmes ci-dessus.

  • Next.js
  • React
  • TypeScript
  • JavaScript
  • Angular
  • Tailwind CSS

MLOps / LLMOps

Suivi d'expériences, versionnement, CI et passerelles de mise en production.

  • MLflow
  • DVC
  • ZenML
  • Docker
  • GitHub Actions
  • CI/CD
  • Prometheus
  • Grafana
  • pytest

Cloud / Infrastructure

Où cela tourne, et ce que cela coûte de le maintenir.

  • AWS
  • AWS Lambda
  • Linux
  • CUDA
  • Google Gen AI Toolbox
  • Google Colab

Contact

Ouvert aux postes d'ingénieur IA et LLM.

Basé à Sousse, Tunisie — ouvert au télétravail et à la mobilité. Le plus rapide reste l'e-mail.

Formation

  • Diplôme d'ingénieur en informatique

    ENSI, Manouba

    2023 — 2026

  • Cycle préparatoire scientifique — Mathématiques et Physique

    ESSTHS, Hammam Sousse

    2021 — 2023

Langues

  • AnglaisAvancé
  • FrançaisAvancé
  • ArabeLangue maternelle