Prompt Engineering Avanzado para LLMs
Técnicas profesionales de prompt engineering: zero-shot, few-shot, chain-of-thought, y evaluación de prompts para modelos locales
Técnicas profesionales de prompt engineering: zero-shot, few-shot, chain-of-thought, y evaluación de prompts para modelos locales
Análisis práctico de cuándo usar un LLM local y cuándo una API cloud: fórmula de coste real, TTFT frente a tokens/s, requisitos legales de privacidad, versionado de modelos y una arquitectura de fallback multi-servidor implementada en este repositorio
Qué se mide realmente en un servicio de inferencia LLM: TTFT, TPOT, KV cache, throughput y coste por token, con métricas de vLLM, instrumentación de Ollama, dashboards Grafana y alertas útiles
Guía completa para evaluar rendimiento de LLMs: benchmarks MMLU, HellaSwag, métricas BLEU/ROUGE, testing de latencia y herramientas de evaluación
Guía rápida de MCP: protocolo para compartir contexto entre clientes y servidores de modelos, y FastMCP como implementación ligera
🚧 TRADUCCIÓN PENDIENTE – Contenido en desarrollo Introducción Esta guía compara los principales frameworks para ejecutar modelos de lenguaje grandes (LLMs) localmente, enfocándonos en facilidad de uso, rendimiento y casos de uso. Frameworks Principales Ollama Descripción: Framework ligero para ejecutar…
Empaquetar un servicio de inferencia (vLLM, Ollama) como chart de Helm y desplegarlo por GitOps con ArgoCD: values, probes para modelos que tardan minutos en cargar, gestión de pesos, secretos, multi-release y escalado por cola.
Conceptos fundamentales de LLMs, arquitectura transformers, diferencias entre modelos open-source vs proprietary y aplicaciones en DevOps
Introducción completa al fine-tuning de modelos de lenguaje: preparación de datos, técnicas de entrenamiento, evaluación y deployment
Evaluación de consistencia, reproducibilidad y detección de sesgos en modelos de lenguaje