Aller au contenu
K1903 · Collective.work

Tech lead Expert Data Retrieval RAG - Freelance (H/F)

Description du poste

LE CONTEXTE

Rejoignez une aventure data au cœur de la Legaltech : notre client construit le moteur de recherche et d'indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l'Europe.

Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle.

VOS MISSIONS AU QUOTIDIEN

  1. Collecte, ingestion & indexation

Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.

Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles.

Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning).

  1. Recherche & pertinence (Retrieval)

Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées.

Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.

Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).

Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays).

  1. Leadership technique & gouvernance

Promouvoir une culture Clean Code, SOLID et tests automatisés.

Contribuer au rayonnement technique du groupe (articles, meetups, open-source).

FORMATION

Master, PhD ou équivalent.

COMPÉTENCES ATTENDUES

Expérience avérée en data engineering / information retrieval sur des volumes massifs en production.

Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.

Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.

Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving).

Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses.

Anglais fluide (contexte européen quotidien).

SOFT SKILLS

Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.

Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.

Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.

Esprit d'innovation : curiosité pour les avancées IA, NLP et data.

Communication : savoir vulgariser des concepts complexes.

Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)

Données marché — Juriste

Salaire net mensuel
Débutant3 894
Moyen4 653
Expérimenté5 338
Tension du marché

Données non disponibles

Projets de recrutement
2 967

postes prévus (BMO 2025)

À ne pas manquer

Offres similaires.