Optimización de Prompts
Los primeros éxitos con el aprendizaje basado en prompts demostraron que la forma en que se redactan las tareas puede afectar drásticamente el rendimiento de un modelo de lenguaje (LLM). En su trabajo seminal, Brown et al. (2020) argumentan que los prompts de texto cuidadosamente elaborados podrían inducir a los LLM a realizar nuevas tareas sin ninguna actualización de parámetros. Junto con los hallazgos empíricos relacionados con la efectividad de los LLM en una amplia variedad de tareas, esto impulsó el interés en la ingeniería de prompts. Sin embargo, diseñar prompts a mano resultó ser un esfuerzo engorroso y propenso a errores, que requería experiencia y una extensa prueba y error (Liu et al., 2023).
Una línea de trabajo inicial se centró en la búsqueda automatizada de prompts en un entorno continuo. En particular, Shin et al. (2020) introdujeron AutoPrompt, un algoritmo de búsqueda guiado por gradientes para encontrar frases de activación de entrada que persuaden a los modelos a tener los comportamientos deseados.
Más tarde, Ma et al. (2023) continuaron con un enfoque discreto para la optimización de prompts, generando prompts automáticamente mediante la extracción de corpus y la parafraseo de prompts existentes.
Estos enfoques demostraron que el descubrimiento automático de prompts es factible y efectivo. También surgieron métodos de ajuste de prompts basados en gradientes, incluyendo técnicas como prefix-tuning (Li et al., 2021) y prompt tuning (Lester et al., 2021). Ambos enfoques aprenden representaciones continuas (prompt embeddings) que se anteponen a las entradas, actualizando solo un pequeño número de parámetros y dejando el modelo principal sin cambios en el momento de la inferencia.
Un enfoque sin gradientes que no requiere acceso a los componentes internos del modelo —solo opera con los tokens de entrada que se le dan al modelo— es RLPrompt (Deng et al., 2022), que formula el diseño de prompts como un problema de aprendizaje por refuerzo (RL).
Estas técnicas son adecuadas para escenarios donde los componentes internos del modelo son inaccesibles y dieron como resultado cadenas de prompts poco intuitivas pero efectivas.
Una taxonomía de la optimización de prompts
Prompting aumentado por recuperación
El prompting aumentado por recuperación incorpora información externa (por ejemplo, documentos, ejemplos) en el prompt. Esto incluye la generación aumentada por recuperación (RAG), que añade contexto recuperado al prompt (Lewis et al., 2020), y el prompting basado en ejemplos, que selecciona demostraciones de un conjunto de datos (Rubin et al., 2021). Aunque son efectivos, estos métodos dependen de la infraestructura de recuperación, así como de datos correctamente etiquetados, lo que dificulta su adopción en casos donde alguna de estas suposiciones se viola.
Ajuste continuo de prompts
Los métodos de ajuste continuo de prompts representan los prompts como vectores entrenables. Claramente, esto asume tener acceso a los componentes internos del modelo, ya que estos vectores entrenables se alimentan luego a las capas del transformador para la generación condicional. Los vectores entrenables pueden cambiarse parcial (prefix tuning) o totalmente (prompt tuning). Prefix-tuning (Li et al., 2021) y prompt tuning (Lester et al., 2021) realizan la optimización de prompts primero incrustando el prompt candidato en un vector y luego actualizándolo, lo que permite una adaptación eficiente. Estos métodos se basan en gradientes y asumen acceso a los componentes internos del modelo, lo que los hace no aplicables a modelos solo de API.
Optimización discreta de caja negra
Las técnicas de caja negra, como la búsqueda manual, las estrategias evolutivas y el aprendizaje por refuerzo, funcionan sin acceso a gradientes y, por lo tanto, son igualmente utilizables tanto para modelos de pesos abiertos como cerrados. En particular, RLPrompt (Deng et al., 2022) utiliza una red de políticas entrenada mediante aprendizaje por refuerzo (RL) para generar prompts basados en señales de recompensa. Aunque son efectivos, estos métodos suelen ser ineficientes en cuanto a muestras y computacionalmente costosos.
Profundizando en la optimización de prompts auto-supervisada (SPO)
En su trabajo, Xiang et al. (2025) proponen la optimización de prompts auto-supervisada (SPO), que (i) elimina la necesidad de una verdad fundamental al usar el LLM para evaluar sus propias salidas y (ii) combina modelos más grandes y más pequeños en un bucle de auto-referencia para una mayor eficiencia de muestreo y velocidad, optimizando prompts usando tan solo tres ejemplos.
SPO ejecuta un bucle iterativo donde el(los) modelo(s) actúa(n) como un ejecutor de prompts (realizando una tarea dado un prompt ( p_k, \phi(p_k) \in \mathcal{T} )), evaluador (mapeando la salida del modelo a una métrica escalar de rendimiento ( e: \mathcal{T} \mapsto \mathbb{R} , e(\phi(p_k)) \in \mathbb{R} )), y optimizador (optimizando ( p_{k+1} ) con ( e(p_{k+1}) \geq e(p_k) )). A través de comparaciones por pares entre prompts subsiguientes y refinamiento, SPO mejora los prompts ( p_k ) sin supervisión externa. SPO demostró ser altamente eficiente y aplicable tanto a tareas abiertas como cerradas. A diferencia de los métodos basados en gradientes o RL, no requiere datos etiquetados ni componentes internos del modelo. Es adecuado para configuraciones de caja negra y mantiene la interpretabilidad ya que funciona en el espacio del lenguaje natural. Además, SPO ocupa un lugar prometedor en el panorama de la PO, combinando las fortalezas del aprendizaje de caja negra y auto-supervisado mientras minimiza sus limitaciones, y apunta hacia la dirección prometedora de permitir que los modelos optimicen autónomamente sus propios prompts utilizando bucles de retroalimentación internos.
Conocimientos sobre la optimización de prompts
Eficiencia de muestreo Los métodos basados en gradientes tienden a ser más eficientes en cuanto a muestras que la optimización de caja negra, aunque trabajos recientes como SPO (Xiang et al., 2025) demuestran una optimización eficiente utilizando solo unas pocas muestras por iteración. La eficiencia de muestreo es crucial para muchas aplicaciones, especialmente cuando se trata de modelos más grandes o configuraciones de inferencia más lentas.
Dependencia de datos etiquetados El ajuste continuo y el RL a menudo requieren datos etiquetados, mientras que métodos como SPO evitan esto al depender de la auto-evaluación del modelo. En esto, SPO permite eficazmente la optimización de prompts sin depender de datos previamente recopilados, y por lo tanto es preferible cuando hay información limitada disponible para optimizar prompts de manera diferente.
Generalización y transferencia La mayoría de las técnicas de optimización de prompts tienden a ser específicas para cada tarea en la práctica. Algunos prompts (por ejemplo, "Pensemos paso a paso") generalizan mejor. Los prompts descubiertos por RL a veces se transfieren entre modelos (Deng et al., 2022).
Robustez El rendimiento de los prompts puede ser frágil con respecto a la redacción. Los prompts continuos son menos interpretables, y los discretos pueden ser sensibles a pequeños cambios. Métodos como el ensamblaje de prompts ayudan a mitigar esto.
Costo computacional La ingeniería manual de prompts es computacionalmente barata, pero resulta frágil y laboriosa. El ajuste basado en gradientes resulta ser más eficiente en cuanto a computación, mientras que el RL y los métodos basados en búsqueda son costosos debido al número de consultas requeridas del método para iterar y mejorar el prompt. Los enfoques tipo SPO parecen prometedores debido a (i) un número limitado de consultas y (ii) la no utilización de componentes internos del modelo en tiempo de prueba.
Referencias
@article{brown2020language,
title={Language models are few-shot learners},
author={Brown, Tom and Mann, Benjamin and Ryder, Nick and Subbiah, Melanie and Kaplan, Jared D and Dhariwal, Prafulla and Neelakantan, Arvind and Shyam, Pranav and Sastry, Girish and Askell, Amanda and others},
journal={Advances in neural information processing systems},
volume={33},
pages={1877--1901},
year={2020}
}
@article{liu2023pre,
title={Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing},
author={Liu, Pengfei and Yuan, Weizhe and Fu, Jinlan and Jiang, Zhengbao and Hayashi, Hiroaki and Neubig, Graham},
journal={ACM computing surveys},
volume={55},
number={9},
pages={1--35},
year={2023},
publisher={ACM New York, NY}
}
@article{ma2023prompt,
title={Is prompt-based finetuning always better than vanilla finetuning? insights from cross-lingual language understanding},
author={Ma, Bolei and Nie, Ercong and Schmid, Helmut and Sch{\"u}tze, Hinrich},
journal={arXiv preprint arXiv:2307.07880},
year={2023}
}
@article{shin2020autoprompt,
title={Autoprompt: Eliciting knowledge from language models with automatically generated prompts},
author={Shin, Taylor and Razeghi, Yasaman and Logan IV, Robert L and Wallace, Eric and Singh, Sameer},
journal={arXiv preprint arXiv:2010.15980},
year={2020}
}
@article{li2021prefix,
title={Prefix-tuning: Optimizing continuous prompts for generation},
author={Li, Xiang Lisa and Liang, Percy},
journal={arXiv preprint arXiv:2101.00190},
year={2021}
}
@article{lester2021power,
title={The power of scale for parameter-efficient prompt tuning},
author={Lester, Brian and Al-Rfou, Rami and Constant, Noah},
journal={arXiv preprint arXiv:2104.08691},
year={2021}
}
@article{deng2022rlprompt,
title={Rlprompt: Optimizing discrete text prompts with reinforcement learning},
author={Deng, Mingkai and Wang, Jianyu and Hsieh, Cheng-Ping and Wang, Yihan and Guo, Han and Shu, Tianmin and Song, Meng and Xing, Eric P and Hu, Zhiting},
journal={arXiv preprint arXiv:2205.12548},
year={2022}
}
@article{rubin2021learning,
title={Learning to retrieve prompts for in-context learning},
author={Rubin, Ohad and Herzig, Jonathan and Berant, Jonathan},
journal={arXiv preprint arXiv:2112.08633},
year={2021}
}
@article{lewis2020retrieval,
title={Retrieval-augmented generation for knowledge-intensive nlp tasks},
author={Lewis, Patrick and Perez, Ethan and Piktus, Aleksandra and Petroni, Fabio and Karpukhin, Vladimir and Goyal, Naman and K{\"u}ttler, Heinrich and Lewis, Mike and Yih, Wen-tau and Rockt{\"a}schel, Tim and others},
journal={Advances in neural information processing systems},
volume={33},
pages={9459--9474},
year={2020}
}
@article{xiang2025self,
title={Self-Supervised Prompt Optimization},
author={Xiang, Jinyu and Zhang, Jiayi and Yu, Zhaoyang and Teng, Fengwei and Tu, Jinhao and Liang, Xinbing and Hong, Sirui and Wu, Chenglin and Luo, Yuyu},
journal={arXiv preprint arXiv:2502.06855},
year={2025}
}