Tech lead Expert Data Retrieval RAG - Freelance (H/F)
Description du poste
LE CONTEXTE
Rejoignez une aventure data au cœur de la Legaltech : notre client construit le moteur de recherche et d'indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l'Europe.
Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle.
VOS MISSIONS AU QUOTIDIEN
- Collecte, ingestion & indexation
Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles.
Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning).
- Recherche & pertinence (Retrieval)
Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées.
Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.
Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).
Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays).
- Leadership technique & gouvernance
Promouvoir une culture Clean Code, SOLID et tests automatisés.
Contribuer au rayonnement technique du groupe (articles, meetups, open-source).
FORMATION
Master, PhD ou équivalent.
COMPÉTENCES ATTENDUES
Expérience avérée en data engineering / information retrieval sur des volumes massifs en production.
Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.
Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.
Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving).
Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses.
Anglais fluide (contexte européen quotidien).
SOFT SKILLS
Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.
Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.
Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.
Esprit d'innovation : curiosité pour les avancées IA, NLP et data.
Communication : savoir vulgariser des concepts complexes.
Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)
Données marché — Juriste
Données non disponibles
postes prévus (BMO 2025)