Daniel Poncelas

Ingeniero de machine learning | seguridad en IA

Daniel Poncelas Vargas

Construyo sistemas de machine learning y mido cómo fallan. Mi tesis somete ocho defensas contra prompt injection a unas 40.000 ejecuciones de agente sobre ocho modelos, y en paralelo llevo dos productos propios.

Todo lo que hay en esta página enlaza a algo que puedes abrir.

danielponcelasvar@gmail.com LinkedIn Descargar CV

Mapa de calor de la tasa de éxito del ataque para cada par de defensa y modelo en AgentDojo
Fig. 01 Tasa de éxito del ataque para cada par de defensa y modelo en AgentDojo. Cuanto más claro, más seguro.
Ubicación
Valencia, España
Elegibilidad
Nacionalidad española, permiso de trabajo en la UE. Dispuesto a mudarme y a que me patrocinen el visado.
Disponible
De forma inmediata, sin fechas que proteger
Idiomas
Español y catalán nativos, inglés C1 (Cambridge)

Trabajo fin de máster

Evaluación sistemática de defensas contra prompt injection en agentes LLM, con análisis mecanicista de modos de fallo

Defensa en septiembre de 2026 | Máster en Inteligencia Artificial, Reconocimiento de Formas e Imagen Digital, UPV

Un agente LLM que lee contenido externo puede ser secuestrado por instrucciones escondidas dentro de ese contenido. OWASP sitúa el prompt injection como el principal riesgo de seguridad para aplicaciones LLM. La literatura propone defensas más rápido de lo que las compara, y cada artículo publica bajo sus propias condiciones, así que ninguna de esas cifras se puede leer en paralelo.

Así que monté un único harness y las ejecuté todas en condiciones idénticas: mismos benchmarks, mismos modelos, mismas métricas y el mismo tratamiento estadístico. Después abrí el modelo por dentro para preguntar por qué fallan las defensas que fallan.

Escala del estudio

8
defensas evaluadas
8
modelos, de 3B a 70B
~40.000
ejecuciones de agente
2
benchmarks
Defensa sep 2026
  1. Resultado 1

    El tamaño no compra robustez

    Tanto en Llama como en Qwen, la tasa de éxito del ataque sube en cada escalón de parámetros: Llama pasa de 0,02 a 3B a 0,36 a 70B. Los modelos pequeños no son seguros, son incapaces, y sus cifras de utilidad lo dicen. Entre familias no es una ley limpia, porque Qwen 7B es más capaz que GPT 4.1 nano y aun así más difícil de secuestrar: el proveedor y el entrenamiento pesan tanto como el tamaño.

  2. Resultado 2

    H1 refutada: entrenar no es la respuesta

    Esperaba que ganase la defensa por fine tuning. No gana. SecAlign queda dominada en Pareto por las defensas por prompting: a 8B, el prompting alcanza la misma tasa de éxito del ataque conservando más utilidad.

  3. Resultado 3

    Un circuito distribuido, no cuatro cabezas

    Activation patching y logit lens sobre Llama 3.2 3B, en 28 capas por 24 cabezas y 119 casos de secuestro, no encontraron un grupo pequeño de cabezas culpables. Lo publico como el resultado negativo que es.

Defensas
Spotlighting, SecAlign, PromptGuard, paráfrasis, sandwich, reminder y baseline. StruQ se evaluó y se descartó por inviabilidad técnica.
Modelos
GPT 4.1, Claude 4.x, Gemini 2.5, Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, Qwen 2.5 7B y 32B.
Benchmarks
AgentDojo 0.1.35 e InjecAgent, con métricas de utilidad, robustez y rechazo, validadas de forma cruzada y con tests estadísticos.
Infraestructura
vLLM sirviendo los modelos abiertos con tool calling sobre un clúster SLURM. El harness de AgentDojo extendido para aceptar backends de modelo arbitrarios.
Gráfico de la tasa de éxito del ataque frente al tamaño del modelo en Llama y Qwen
Fig. 02 Tanto en Llama como en Qwen, la tasa de éxito del ataque sube con el número de parámetros.
Dispersión de utilidad frente a tasa de éxito del ataque a 8B para prompting y para SecAlign
Fig. 03 Utilidad frente a tasa de éxito del ataque a 8B. El prompting iguala a la defensa entrenada con más utilidad, lo que refuta H1.
Curva de logit lens con el margen del token del atacante por capa en Llama 3.2 3B
Fig. 04 Logit lens sobre Llama 3.2 3B. El margen del token del atacante cruza el cero cerca de la capa 15: el modelo se compromete tarde.

Productos que construyo y opero

Dos cosas que lancé yo solo, y los números que hacen de verdad

Dado de alta como autónomo en España, facturando desde 2025

GenTotalAI

Arrancado en marzo de 2026

En marcha

Generación de vídeo con IA para creadores y negocios pequeños de habla hispana: avatares que hablan, promoción de producto, anuncios cortos. Créditos y suscripción, captación íntegra por publicidad de pago.

gentotal.ai Ábrelo y compruébalo

Medido el 4 de agosto de 2026

5.247 €
MRR+16,4% MoM
190
suscriptores activos
14.158
trabajos de generación procesados
~24.000 €
facturado hasta la fechaen 5 meses
78,09 €
valor de vida del cliente
27,6%
churn mensual
De qué respondo
Producto, precios, captación y economía del negocio. Diseño y opero el sistema, y leo las cohortes, el churn y el LTV que deciden qué se construye después. Dado de alta como autónomo y facturando.
Pipeline de generación
Multiproveedor y multimodal: texto a JSON, texto a imagen, imagen a imagen, imagen a vídeo, varias imágenes a vídeo y vídeo a vídeo con cambio de identidad y de voz. Enrutado entre GPT 4.1 nano, Grok, Gemini, Flux, Kling v2.6 y ElevenLabs.
Plataforma
Next.js y Express, PostgreSQL sobre Supabase, Supabase Auth, Redis y BullMQ para trabajos asíncronos, Socket.io para el progreso en vivo, Stripe, Cloudflare R2, Nginx y PM2, GitHub Actions desplegando por SSH a un VPS de DigitalOcean. Instrumentado con PostHog.
La parte incómoda
El margen es ajustado y algunos meses cierran en negativo, porque la palanca de crecimiento es la inversión en publicidad. Mantengo el crecimiento plano hasta que la economía unitaria mejore, en lugar de comprar ingresos.

StudyOS

Lanzado en junio de 2025, pico en octubre de 2025

En la App Store

Asistente de estudio para iOS basado en LLM. Entran los apuntes y salen sesiones de estudio, cuestionarios y flashcards. Construido y publicado por mí solo, desde la app en Swift hasta la ficha de la App Store.

apps.apple.com Ábrelo y compruébalo

Cifras en el pico, declaradas por mí

~77.000
usuarios nuevos el primer año
~300
suscriptores en el pico
~42.000 $
ARR en el pico
~24.000 $
facturado el primer añoa lo largo de 12 meses
Stack
Swift, Firebase, Supabase y APIs de LLM. Unos 25 € al mes de infraestructura frente a los ingresos por suscripción.
Dónde está hoy
Sigue descargable y sigue generando, mantenida a baja intensidad. El cuello de botella resultó ser la distribución y no el producto, y sobre esa lección está construido GenTotalAI.

Experiencia

Computer Vision & AI Research Engineer

Evestel Iberia | visión por computador para analítica de retail y monitorización del conductor

  • sep 2023 → ene 2024 Prácticas, jornada parcial
  • may 2024 → ago 2024 Prácticas
  • mar 2025 → oct 2025 Contrato a jornada completa
En producción

Startup de visión por computador que trabaja en seguimiento de personas para retail y espacios públicos, y en sistemas de monitorización del conductor (somnolencia y alcohol) que van a ser obligatorios en transporte público. Equipo pequeño, reportando al CTO.

  • Detección, seguimiento y reidentificación de personas de extremo a extremo, desde la primera detección hasta el emparejamiento de identidad entre cámaras.
  • Evalué las arquitecturas candidatas, propuse la migración de YOLOv5 a YOLOv11 con reidentificación por embeddings y la llevé a cabo.
  • Exportación y optimización de modelos con ONNX y TensorRT para su despliegue.
  • Inferencia acelerada sobre NVIDIA CUDA y sobre AMD ROCm, donde el soporte de YOLO era lo bastante escaso como para convertirse en la parte difícil del trabajo.
  • Datasets de 10.000 a 15.000 imágenes en Roboflow con scripts de automatización, y análisis de errores sobre falsos positivos y falsos negativos.
  • Modelos que entrené y ajusté llegaron a producción y siguen ahí funcionando.

Formación

Cinco ciudades, una sola materia

Valencia, Múnich, Estocolmo, Dublín, Zúrich

  1. sep 2025 → sep 2026 Máster en Inteligencia Artificial, Reconocimiento de Formas e Imagen Digital Universitat Politècnica de València 8,7 / 10, dos matrículas de honor
  2. sep 2021 → jul 2025 Grado en Ingeniería Informática, especialidad en Inteligencia Artificial Universitat Politècnica de València, 240 ECTS 9,1 / 10, top 1% de la promoción, diez matrículas de honor
  3. ene → dic 2025 Honours Degree in Technology Management CDTM, centro conjunto de la TU de Múnich y la LMU de Múnich Unos 15 admitidos por promoción. Proyecto de I+D con Rover sobre protección de trabajadores en obra.
  4. ago 2024 → ene 2025 Asignaturas de máster en IA: machine learning, deep learning, visión por computador y programación en GPU KTH Royal Institute of Technology, Estocolmo, 30 ECTS 8,6 / 10
  5. ene → jun 2024 Erasmus, mención en Inteligencia Artificial Trinity College Dublin, 30 ECTS 9,5 / 10
  6. jun 2025 Programa de verano en IA y machine learning ETH Zúrich Una semana. Admitido con CV y carta de motivación. Fine tuning de modelos Llama.

Busco mi primer puesto tras el máster: machine learning, seguridad en IA, visión por computador, datos o MLOps. En Europa o en remoto. No tengo ninguna fecha que proteger, así que puedo empezar cuando convenga.

danielponcelasvar@gmail.com

linkedin.com/in/daniel-poncelas-vargas CV de una hoja, PDF Valencia, España