Principal Coding Annotator / LLM Evaluation Engineer

Remote • Posted 7 hours ago • Updated 7 hours ago
Full Time
On-site
Fitment

Dice Job Match Score™

🔢 Crunching numbers...

Job Details

Skills

  • Art
  • Large Language Models (LLMs)
  • Workflow
  • Software Engineering
  • Code Refactoring
  • Debugging
  • Reasoning
  • Software Development
  • Artificial Intelligence
  • Fluency
  • English
  • Team Leadership
  • Mentorship
  • Evaluation
  • Public Relations
  • LES
  • Valuation
  • SAP LE
  • Python
  • Mergers and Acquisitions
  • Customer Engagement

Summary

This is a contracting engagement - initially 6 months - with potential for long term engagement.

Location: Paris or London-based preferred; alternatively Europe remote for strong candidates

We are building and evaluating state-of-the-art large language models (LLMs) and are looking for experienced software engineers to join our evaluation and annotation team. This role sits at the intersection of real-world software engineering, model evaluation, and applied AI , and is critical to improving model reliability, reasoning, and code quality.

You will design challenging coding tasks, evaluate model outputs against rigorous benchmarks, identify failure modes, and contribute to reinforcement learning and model improvement workflows.

This is not a junior annotation role. We are looking for practitioners with deep hands-on coding experience who can think like both an engineer and an evaluator.

What You'll Do
  • Create high-quality coding prompts and reference answers (benchmark-style, e.g. SWE-Bench-like problems).
  • Evaluate LLM outputs for code generation, refactoring, debugging, and implementation tasks.
  • Identify and document model failures, edge cases, and reasoning gaps.
  • Perform head-to-head evaluations between private LLMs (Mistral-based) and leading external models.
  • Build or configure coding environments to support evaluation and reinforcement learning (RL).
  • Follow detailed annotation and evaluation guidelines with high consistency.
What We're Looking For
  • 10+ years of professional software development experience .
  • Strong Python skills (required).
  • Knowledge of at least one additional programming language (bonus).
  • 1+ year of coding annotation and/or LLM evaluation experience (part-time OK) for a major frontier AI lab or AI infrastructure company.
  • Prior code reviewer experience is a plus.
  • Proven ability to apply structured evaluation criteria and write clear technical feedback.
  • Fluent in English (written and spoken) .
  • Team lead or mentoring experience is a strong plus.
Why This Role
  • Work hands-on with cutting-edge LLMs.
  • Apply real-world engineering judgment to model evaluation and improvement.
  • High-impact, technical work with a focused, senior team.

_______________

Il s'agit d'une mission contractuelle - initialement de 6 mois - avec possibilit de prolongation.

Lieu : Poste bas Paris/London de prfrence ; possibilit de tltravail en Europe pour les candidats les plus qualifis.

Nous dveloppons et valuons des modles de langage de grande taille (LLM) de pointe et recherchons des ingnieurs logiciels expriments pour rejoindre notre quipe d'valuation et d'annotation. Ce poste se situe l'intersection du gnie logiciel, de l'valuation de modles et de l'IA applique, et est essentiel l'amlioration de la fiabilit des modles, du raisonnement et de la qualit du code.

Vous concevrez des tches de programmation stimulantes, valuerez les rsultats des modles par rapport des benchmarks rigoureux, identifierez les modes de dfaillance et contribuerez aux processus d'apprentissage par renforcement et d'amlioration des modles.

Ce poste ne s'adresse pas aux annotateurs juniors. Nous recherchons des professionnels possdant une solide exprience pratique en programmation, capables d'adopter une approche la fois ingnieure et valuatrice.

Vos missions :

  • Crer des consignes de programmation et des rponses de rfrence de haute qualit (de type benchmark, par exemple des problmes similaires SWE-Bench). valuer les rsultats des modles de langage (LLM) pour la gnration de code, la refactorisation, le dbogage et l'implmentation.
  • Identifier et documenter les dfaillances des modles, les cas limites et les lacunes de raisonnement.
  • Effectuer des valuations comparatives directes entre les LLM privs (bass sur Mistral) et les principaux modles externes.
  • Concevoir ou configurer des environnements de dveloppement pour l'valuation et l'apprentissage par renforcement (RL).
  • Suivre rigoureusement les directives d'annotation et d'valuation.


Profil recherch :

  • Plus de 10 ans d'exprience professionnelle en dveloppement logiciel.
  • Excellente matrise de Python (obligatoire).
  • Connaissance d'au moins un autre langage de programmation (un atout).
  • Au moins un an d'exprience en annotation de code et/ou en valuation de LLM (temps partiel possible) au sein d'un laboratoire d'IA de pointe ou d'une entreprise d'infrastructure d'IA.
  • Une exprience en revue de code est un plus.
  • Capacit avre appliquer des critres d'valuation structurs et rdiger des retours techniques clairs.
  • Matrise de l'anglais (crit et oral).
  • Une exprience en gestion d'quipe ou en mentorat est un atout majeur.


Pourquoi ce poste ?

  • Travaillez concrtement avec des LLM de pointe.
  • Appliquez votre expertise d'ingnieur l'valuation et l'amlioration des modles.
  • Contribuez un travail technique fort impact au sein d'une quipe senior spcialise.
Employers have access to artificial intelligence language tools (“AI”) that help generate and enhance job descriptions and AI may have been used to create this description. The position description has been reviewed for accuracy and Dice believes it to correctly reflect the job opportunity.
  • Dice Id: vonqfeed2
  • Position Id: 960997059
  • Posted 7 hours ago
Create job alert
Set job alertNever miss an opportunity! Create an alert based on the job you applied for.

Similar Jobs

Remote or Leuven, Flanders

Today

Full-time

Remote or Antwerp, Flanders

Today

Full-time

Remote or Ghent, Flanders

Today

Full-time

Remote or Liège, Wallonia

Today

Full-time

Search all similar jobs