Reserved IP Ranges

Bloques de direcciones privadas (RFC 1918), de documentación y reservadas (CG-NAT, Loopback).

Bloques de direcciones privadas (RFC 1918), de documentación y reservadas (CG-NAT, Loopback).

Técnicas profesionales de prompt engineering: zero-shot, few-shot, chain-of-thought, y evaluación de prompts para modelos locales

Análisis práctico de cuándo usar un LLM local y cuándo una API cloud: fórmula de coste real, TTFT frente a tokens/s, requisitos legales de privacidad, versionado de modelos y una arquitectura de fallback multi-servidor implementada en este repositorio

Qué se mide realmente en un servicio de inferencia LLM: TTFT, TPOT, KV cache, throughput y coste por token, con métricas de vLLM, instrumentación de Ollama, dashboards Grafana y alertas útiles

Guía completa para evaluar rendimiento de LLMs: benchmarks MMLU, HellaSwag, métricas BLEU/ROUGE, testing de latencia y herramientas de evaluación

Guía rápida de MCP: protocolo para compartir contexto entre clientes y servidores de modelos, y FastMCP como implementación ligera

🚧 TRADUCCIÓN PENDIENTE – Contenido en desarrollo Introducción Esta guía compara los principales frameworks para ejecutar modelos de lenguaje grandes (LLMs) localmente, enfocándonos en facilidad de uso, rendimiento y casos de uso. Frameworks Principales Ollama Descripción: Framework ligero para ejecutar…

Empaquetar un servicio de inferencia (vLLM, Ollama) como chart de Helm y desplegarlo por GitOps con ArgoCD: values, probes para modelos que tardan minutos en cargar, gestión de pesos, secretos, multi-release y escalado por cola.

Conceptos fundamentales de LLMs, arquitectura transformers, diferencias entre modelos open-source vs proprietary y aplicaciones en DevOps

Introducción completa al fine-tuning de modelos de lenguaje: preparación de datos, técnicas de entrenamiento, evaluación y deployment