Ejecutar modelos de IA en local: guía práctica para tener tu propio ChatGPT en tu PC con privacidad total
Tiempo de lectura estimado: 14 minutos
Claves rápidas
- Privacidad total: tus datos no salen de tu equipo si mantienes el flujo 100% local.
- Rendimiento y control: elige modelos, cuantización y contexto según tu hardware y tareas.
- Herramientas: LM Studio (interfaz visual), Ollama (consola e integración) y ComfyUI (imágenes/vídeo).
- Casos reales: OCR y resúmenes, correos y traducciones, análisis de papers, imágenes/animación y apps de código.
- Importante: la app oficial de ChatGPT para Windows requiere internet; no es 100% local.
Tabla de contenidos
- Qué significa “Tener tu propio ChatGPT en tu PC”
- Requisitos y preparación del entorno
- Sección 1 — LM Studio (ChatGPT en local con interfaz visual)
- Sección 2 — Ollama en Windows (alternativa ligera y en consola)
- Flujo práctico 2 — Análisis de PDF con Ollama (Razonamiento)
- Sección 3 — Creatividad en local: imágenes y vídeo con ComfyUI
- Sección 4 — Programación asistida: código en local
- Estrategia de trabajo: combina modelos
- Privacidad, seguridad y cumplimiento
- Optimización y resolución de problemas
- Checklist final de implementación
- Cierre y llamada a la acción
- Conclusión
- FAQ
¿Quieres un “ChatGPT” que no dependa de la nube? Hoy es posible. Puedes ejecutar modelos de IA en local en tu PC para texto, imágenes, vídeo y código. Ganarás privacidad, control y velocidad, sin suscripciones ni sustos por cambios de plataforma.
- Privacidad y confidencialidad: tus datos no salen de tu equipo.
- Fiabilidad: funciona aunque internet vaya mal o el servicio caiga.
- Coste y personalización: rendimiento nivel pro sin cuotas y con ajustes a tu gusto.
Qué aprenderás:
- ChatGPT en local con LM Studio (interfaz visual) y Ollama en Windows (CLI).
- Flujos completos para texto/visión (OCR, resúmenes, correos y traducción).
- Pautas de hardware, modelos, cuantización y métricas clave.
Nota importante: la app oficial de ChatGPT para Windows no ejecuta el modelo en tu PC; necesita internet y se conecta a los servidores de OpenAI, por lo que no ofrece privacidad completa. Para privacidad total, usa soluciones 100% locales como las descritas en esta guía práctica de Xataka.
Sigue leyendo: en minutos tendrás tu stack local funcionando.
Qué significa “Tener tu propio ChatGPT en tu PC”
“Tener tu propio ChatGPT” en local es montar un pequeño stack de IA en tu ordenador:
- Un modelo de lenguaje (LLM) para chatear, resumir, traducir y razonar.
- Un modelo de visión para leer imágenes o PDFs escaneados (OCR + comprensión).
- Modelos creativos para generar y editar imágenes/vídeo.
- Opcional: modelos de código para programar con ayuda.
Casos de uso reales:
- Transcribir y resumir documentos escaneados.
- Redactar y traducir correos (tono claro para un paciente, formal para un juez).
- Analizar papers: idea principal, método y explicaciones simples.
- Crear y editar imágenes (posters con texto, estilos, inpainting).
- Animar imágenes a vídeo corto.
- Generar código útil (por ejemplo, una calculadora hipotecaria web).
Todo esto ocurre en tu PC. Sin telemetría ni subidas a la nube, si mantienes el flujo 100% local, como subraya la referencia de Xataka.
Requisitos y preparación del entorno
Hardware recomendado (PC de escritorio o portátil “gaming” va perfecto):
- CPU moderna (mejor con AVX2) para empujar modelos en CPU si no hay GPU.
- RAM: 16–32 GB según modelos y tareas. 16 GB es el “dulce” inicial.
- GPU Nvidia RTX para acelerar imágenes/vídeo y LLMs: 8–16 GB de VRAM o más.
- Almacenamiento: deja espacio para modelos; cada uno puede ocupar 2–30+ GB (pesos GGUF/cuantizados).
Sistemas operativos:
- Windows (foco del artículo): todo el tutorial está pensado para aquí.
- Mac/Linux: LM Studio y Ollama también existen; la lógica es la misma.
Conceptos base para elegir modelos:
- Parámetros vs. rendimiento: más parámetros suele dar más calidad, pero pide más VRAM/RAM.
- Cuantización (GGUF/INT4/INT8): comprime el modelo para que quepa y vaya más rápido, con ligera pérdida de precisión.
- Velocidad (tokens/s) y latencia de primer token: como “palabras por segundo” y tiempo de arranque.
- Contexto (ventana): cuántas “páginas” puede leer/recordar a la vez.
- Multimodalidad: si necesitas texto + visión (leer imágenes/PDFs).
- Razonamiento y herramientas: algunos modelos son mejores explicando o usando plugins locales.
Consejo mental: piensa en los modelos como coches. Un 7B cuantizado es un utilitario veloz en ciudad; un 27–32B es un todoterreno para proyectos largos y difíciles.
Sección 1 — LM Studio (ChatGPT en local con interfaz visual)
Qué es LM Studio y cuándo usarlo
LM Studio es una app con interfaz gráfica para descargar, gestionar y chatear con modelos LLM open source en tu PC. Ideal si quieres algo “estilo ChatGPT”, sin tocar consola. Es gratis y funciona 100% en local con los modelos adecuados, tal como resumen la guía de Xataka y este tutorial en YouTube.
Cuándo usarlo:
- Quieres una experiencia de chat directa y cómoda.
- Prefieres seleccionar modelos con clics y ver métricas en pantalla.
- Necesitas multimodalidad básica (texto + visión) en un flujo único.
Instalación en Windows y primer arranque
- Descarga LM Studio desde su web oficial y ejecuta el instalador.
- Abre la app; verás la tienda de modelos y la pestaña de chat.
- Comprueba espacio en disco y cierra apps pesadas para dejar RAM libre.
Recurso: necesitarás al menos 16 GB de RAM o una GPU moderna para un rendimiento fluido, según el modelo elegido, como se ve en el vídeo de LM Studio y en la guía de Xataka.
Carga de modelos recomendados
- Gemma (Google, open source): muy sólido para tareas generales y multimodalidad básica.
- Qwen (Alibaba): gran razonamiento; variantes 7B–14B–32B y versiones cuantizadas (INT4/INT8).
Cómo elegir:
- Portátil con 16 GB RAM y sin GPU: prueba Qwen 7B/14B INT4 (GGUF).
- PC con RTX 3060 (12 GB VRAM): sube a Qwen 14B INT4/INT8 o Gemma 9B/27B cuantizado.
- Proyecto exigente: considera Qwen 32B cuantizado (más lento si no hay mucha VRAM).
Tip: los pesos pueden ocupar desde 4 GB hasta 20+ GB por modelo; descarga 2–3 que te cubran “rápido/medio/grande” como recomienda este tutorial de YouTube.
Configuración clave
- System prompt: define el carácter del asistente. Ejemplo: “Responde siempre en español de España, sé claro y conciso. Si te pido código, incluye comentarios.”
- Selección de modelo por tarea:
- Redacción general: Gemma/Qwen 7B–14B (rápidos).
- Razonamiento duro o documentos largos: Qwen 27B–32B (más precisión).
- Visión (leer imágenes): elige la variante multimodal disponible en LM Studio.
- Métricas útiles:
- Tokens/s: 20–40 fluido; 5–10 utilizable; <5 se siente lento.
- Latencia de primer token: si es alta, baja tamaño del modelo o usa cuantización.
Flujo práctico 1 (texto/visión)
Objetivo: convertir una imagen escaneada de un informe médico forense en conocimiento accionable y correos listos para enviar.
- Carga la imagen escaneada en el chat multimodal.
- Pide OCR + resumen: “Extrae el texto con OCR y da un resumen en 5 viñetas con diagnóstico, hallazgos y fechas clave.”
- Extrae puntos accionables: “Lista de puntos clave para tomar decisiones: 1) riesgos, 2) plazos, 3) citas, 4) documentos faltantes.”
- Redacta dos correos:
- Paciente (claro): “Escribe un correo para el paciente, tono cercano, sin jerga, con próximos pasos.”
- Juez (técnico): “Escribe un correo para el juez, lenguaje formal y técnico, con citas del informe.”
- Traduce al inglés el correo del juez: “Traduce al inglés manteniendo el formato y el tono legal.”
- Optimiza velocidad: si usaste un modelo grande para el análisis, cambia a uno mediano (p. ej., de 27B a 12–14B) para las redacciones.
Consejos:
- Valida el OCR: si la imagen es mala, haz otra foto o aumenta resolución.
- Divide y vencerás: primero resume; luego pide formatos específicos (listas, tablas).
- Guarda plantillas de prompts (“correo paciente”, “correo juez”, “resumen forense”).
LM Studio permite trabajar 100% en local si usas modelos locales. Es ideal si manejas datos sensibles, como explican la demo en YouTube y la guía de Xataka.
Consejos de calidad/velocidad
- Cuándo elegir 27B vs. 12B:
- 27B si hay razonamiento complejo o documentos largos.
- 12–14B para productividad diaria (resúmenes, correos, traducciones).
- Cuantización:
- INT4 (q4_K_M en GGUF) = muy ligero y rápido; pequeña pérdida de precisión.
- INT8 = más fiel, algo más pesado.
- Ahorra tiempo:
- Reutiliza prompts y plantillas por tarea.
- Mantén semillas y versiones apuntadas para reproducibilidad.
- Cierra apps que usen la GPU cuando vayas justo de VRAM.
Más detalles y requisitos en tutoriales como este vídeo de YouTube y el vídeo de Wyzer.ai.
Sección 2 — Ollama en Windows (alternativa ligera y en consola)
Qué es Ollama y cuándo usarlo
Ollama es una plataforma open source para descargar y ejecutar LLMs en local (Windows, Mac y Linux). Es rápida, funciona desde la consola e integra genial con RAG y apps externas. Ideal para automatizar y para PCs modestos, como destaca la guía de Xataka.
- Quieres simplicidad y menos “clics”.
- Vas a integrar el modelo en scripts, editores o servicios locales.
- Necesitas cambiar de modelo con un comando y gestionar cuantizaciones fácilmente.
Instalación en Windows (servicio local)
- Descarga el instalador de Ollama para Windows y ejecútalo.
- El servicio local se inicia automáticamente; también puedes usar “ollama serve”.
- Verifica que funciona con un “ollama run” del modelo que elijas.
Ventajas:
- Sin costes por uso ni suscripciones.
- Descarga directa de modelos populares (Llama, Qwen, Gemma, Mistral…).
- Privacidad total: la conversación se queda en tu PC (ver Xataka).
Descarga y ejecución de modelos
qwen2.5:7b-instruct— rápido y capaz para tareas generales.gemma:7b— buen equilibrio en redacción.- Modelos multimodales (p. ej., LLaVA) si necesitas visión básica.
Sugerencias de memoria:
- Si aparece “out of memory”, baja a q4 (q4_K_M) o reduce el contexto.
- En GPUs con 8–12 GB VRAM, los 7B–14B cuantizados suelen ir muy bien.
Antes de pasar al flujo de PDF, deja afinados LM Studio + Ollama y tus cuantizaciones preferidas.
Flujo práctico 2 — Razonamiento y análisis de PDF con Ollama
Objetivo: entender un paper de 18 páginas y extraer ideas claras para no expertos, todo en local.
- Prepara el PDF en una carpeta, por ejemplo:
C:\ia\docs\paper.pdf. - Lanza un modelo en consola (PowerShell):
ollama pull qwen2.5:7b-instructollama run qwen2.5:7b-instruct
- Prompt inicial:
“Voy a analizar un paper PDF (18 páginas). Objetivo: 1) cuál es la técnica propuesta, 2) en qué mejora al estado del arte, 3) explicación sencilla para un estudiante de 16 años. Pide el texto cuando estés listo.”
- Copia-pega bloques del PDF (2–3 páginas por turno) o usa un mini flujo de RAG local (abajo) para indexarlo y hacer preguntas sin copiar todo.
Preguntas útiles:
- “Resume el método en 7 viñetas con pasos numerados.”
- “Dime tres riesgos/limitaciones y cómo probarías cada uno.”
- “Explica la fórmula clave con palabras y un ejemplo sencillo.”
- “Qué datasets usan y por qué son adecuados.”
Interpretación guiada (chain-of-thought resumida): pide “explicación paso a paso pero breve”. Ejemplo: “Dame 5 pasos lógicos que seguiste para llegar a tu conclusión, en frases cortas.”
Tip de rendimiento:
- Si notas latencia alta, usa
qwen2.5:7b-instructen q4_K_M o reduce el contexto a 4k tokens. - En PCs con 16 GB de RAM, 7B–14B cuantizados suelen ir muy fluidos, como detalla Xataka.
Extensiones útiles con Ollama
- RAG local con tus documentos:
- Usa Open WebUI para chatear sobre PDFs sin código, conectado a Ollama.
- Alternativa: LlamaIndex o Haystack para indexar PDFs y consultar por secciones.
- Beneficio: preguntas precisas sin pegar texto completo (ver guía de Xataka).
- Plantillas y system prompts per-run:
- Guarda prompts en archivos .txt y cárgalos al arrancar.
- Mantén perfiles: “técnico”, “divulgación”, “legal”.
Buenas prácticas con Ollama
- Gestiona VRAM y memoria:
- Prefiere 7B–14B en q4_K_M si tu GPU es de 8–12 GB.
- Baja la ventana de contexto si no necesitas leer mucho de golpe.
- Errores “out of memory”:
- Reinicia el servicio, cierra apps que usan GPU o elige un modelo más pequeño.
- Usa INT4/INT8 para equilibrar fidelidad y velocidad (ver Xataka).
Sección 3 — Creatividad en local: imágenes y vídeo con ComfyUI
Qué es ComfyUI y por qué usarlo
ComfyUI es un entorno visual por nodos para IA generativa. Construyes flujos como piezas de Lego: entrada de texto, modelo, sampler, posprocesado. Es reproducible, rápido y admite plantillas one‑click.
- Resultados consistentes con la misma semilla.
- Edición precisa (inpainting, estilos).
- Animar imágenes a clips cortos sin subir nada a la nube.
Instalación y plantillas
- Descarga ComfyUI desde su repositorio oficial y abre la app.
- En “Plantillas” carga flujos de:
- Text-to-Image (modelo base).
- Edición/Flux Context Diff (inpainting).
- Animación (Wan u otros).
- La interfaz te pedirá bajar modelos y dependencias. Acepta y espera (requiere espacio).
Generación de imágenes (alta adherencia al prompt)
- Modelos de alta adherencia (p. ej., SDXL + LoRAs) funcionan muy bien con frases claras en inglés.
- Texto en imagen:
- Mejor en inglés y con prompts cortos: “A coffee cup with ‘HELLO’ printed on it, product photo, studio lighting.”
- En español puede fallar; prueba mayúsculas, comillas y varias semillas.
- Ajustes rápidos:
- Pasos: 20–30 calidad estándar; 10–15 pruebas rápidas.
- LoRAs: pesos 0.6–0.8 para estilos (cómic, realista).
- Semilla fija: reproduce resultados cambiando solo detalles.
Animación de imágenes a vídeo (modelo Wan)
- Flujo: imagen base → modelo Wan → define movimiento.
- Parámetros:
- FPS: 12–24 según fluidez.
- Frames: 24–72 para clips de 1–3 s.
- Resolución: 720p para probar; 1080p si tu GPU lo permite.
- Casos: parpadeo, bicicletas en movimiento, hojas que caen.
- Requisitos: GPU con 8–12 GB VRAM para 720p; versiones “light” reducen consumo.
Edición inteligente con Flux Context Diff
- Inpainting puntual: enmascara y pide “añadir un sombrero rojo”.
- Colorización: convierte B/N a color con tonos naturales.
- Cambio de estilo: “Estilo Studio Ghibli, misma composición y pose.”
- Rendimiento: en una GPU media, 45–60 s por edición a 1080p es normal.
Sección 4 — Programación asistida: código en local
Modelos de código recomendados
- Qwen Code 30B (cuantizado) para tareas exigentes en local.
- Alternativas 7B–14B si tu VRAM es limitada (con prompt claro compensan bien).
Flujo práctico 3: app de cálculo hipotecario
Objetivo: crear una app web con HTML/CSS/JS que calcule cuota, amortización y muestre gráficos.
- Arranca tu modelo de código (LM Studio u Ollama).
- Prompt: “Genera una app HTML/CSS/JS de cálculo hipotecario: inputs de capital, interés y años; tabla de amortización; gráfico de saldo; diseño responsive; comentarios en el código en español.”
- Copia el resultado en
index.htmly ábrelo en el navegador. - Test rápido:
- Cambia los números y revisa tabla y gráfico.
- Si falla, pide: “Depura el error X y explica por qué.”
Tip: para gráficos, usa Chart.js con CDN para no instalar nada.
Estrategia de trabajo: combina modelos para “superpoderes”
- Elección dinámica:
- Productividad diaria: 7B–14B cuantizados.
- Razonamiento y documentos largos: 27B–32B si tu hardware lo aguanta.
- Visión y OCR: variantes multimodales.
- Código: modelos “Code” especializados.
- Cadena de herramientas:
- Ollama para ingesta/RAG de documentos.
- LM Studio para redacción final con plantillas.
- ComfyUI para assets visuales y vídeos cortos.
- Plantillas de prompts: “Correo médico claro”, “informe técnico breve”, “brief creativo con restricciones”.
Privacidad, seguridad y cumplimiento
- Ventaja clave: datos 100% locales. Sin telemetría si mantienes el flujo en tu PC (ver Xataka).
- Recomendaciones:
- Cifrado de disco (BitLocker o similar).
- Backups locales y en NAS cifrados.
- Segmenta proyectos sensibles con permisos adecuados.
- Límites y ética: no sustituye asesoría médica, legal o financiera. Revisión humana siempre.
- Licencias: revisa la licencia de cada modelo/peso antes de uso comercial.
- Recuerda: la app oficial de ChatGPT para Windows requiere internet y no es 100% local.
Optimización y resolución de problemas
- Va lento:
- Baja de 27B a 14B, usa INT4, reduce temperatura y top‑p.
- En imagen/vídeo, menos pasos y menor resolución.
- Memoria insuficiente:
- Reduce contexto, usa q4_K_M, cierra apps de GPU, activa VRAM compartida si es posible.
- Calidad inconsistente:
- Ajusta el system prompt; pide formatos estrictos (lista, JSON, tabla de texto).
- En imagen, cambia la semilla o sube pasos un 20%.
- Reproducibilidad:
- Anota versión de modelos, cuantización y semillas.
- Guarda plantillas de ComfyUI y prompts junto a los resultados.
Checklist final de implementación
- LM Studio: instala y descarga 2–3 modelos (Gemma y Qwen en tamaños pequeño/mediano/grande).
- Ollama: instala y haz pull de un modelo ligero (
qwen2.5:7b-instruct) y uno de razonamiento. - ComfyUI: importa tres plantillas (text‑to‑image, edición con Flux Context Diff y animación con Wan).
- Prueba tres ejercicios:
- ChatGPT en local: OCR de una imagen escaneada, resumen y dos correos + traducción.
- Análisis de un PDF técnico con preguntas abiertas y RAG local.
- Generación de imagen con texto y animación corta.
- Ajusta rendimiento: cuantización, pasos, semillas y tamaño de modelo. Guarda todo como tu “stack”.
Cierre y llamada a la acción
Tener tu propio ChatGPT en tu PC ya no es un sueño. Con LM Studio, Ollama y ComfyUI trabajas texto, imágenes, vídeo y código con privacidad total, control y sin cuotas. Descarga las herramientas, replica los flujos y crea tu stack hoy mismo. Ejecutar modelos de IA en local te da independencia y velocidad para tu día a día. Revisa la guía de Xataka y esta demo en YouTube para inspiración adicional.
Conclusión
Con un PC moderno puedes montar un entorno de IA generativa completo. LM Studio te da comodidad visual, Ollama potencia en consola e integración fácil con RAG, y ComfyUI creatividad reproducible. El resultado: privacidad, fiabilidad y resultados profesionales sin depender de la nube. Empieza pequeño, mide tokens/s, controla tu VRAM y crece según tus proyectos.
FAQ
¿Necesito internet para usarlo?
Solo para descargar herramientas y modelos. Luego puedes trabajar 100% offline en tu PC. La aplicación oficial de ChatGPT para Windows sí necesita conexión a los servidores de OpenAI.
¿Qué PC mínimo recomiendas?
CPU moderna con AVX2, 16 GB de RAM y, si puedes, una GPU RTX de 8–12 GB VRAM. También funciona solo con CPU, pero más lento (ver vídeo de YouTube y Xataka).
¿Cuánto ocupan los modelos?
Entre 2 y 30+ GB según tamaño y cuantización (GGUF/INT4/INT8). Descarga 2–3 para cubrir tareas rápidas y pesadas, como comentan en este tutorial.
¿LM Studio o Ollama?
LM Studio si prefieres interfaz gráfica y chat cómodo. Ollama si quieres scripts, RAG local y control por consola. Ambos son gratuitos y locales (ver Xataka).
¿Puedo usar Mac o Linux?
Sí. LM Studio y Ollama soportan Mac y Linux con lógica similar. Este tutorial se centra en Windows, pero los pasos se parecen (ver guía de Xataka).
¿Qué es cuantización y por qué importa?
Es comprimir el modelo (INT4/INT8) para que consuma menos memoria y vaya más rápido, con ligera pérdida de precisión. Úsala para encajar modelos grandes en equipos modestos.
¿Cómo mejoro la calidad de las respuestas?
Define un buen system prompt, pide formatos claros y baja la temperatura. Para razonamiento duro, usa un modelo más grande temporalmente.
¿Puedo usar GPU AMD?
Sí, pero el soporte varía según herramienta y backend. En Windows, Nvidia suele ir más fina para LLM e imagen por el ecosistema de librerías.
¿Cómo hago RAG local sin programar?
Usa Open WebUI conectado a Ollama, o la función de documentos de LM Studio si está disponible. Así haces preguntas sobre tus PDFs sin copiar texto (ver Xataka).
¿Es legal usar estos modelos para trabajo?
Sí, pero revisa la licencia de cada modelo/peso y las condiciones de uso comercial. Mantén revisión humana en decisiones críticas.
¿Por qué mis imágenes no respetan el texto en español?
Los modelos de imagen escriben mejor en inglés. Usa palabras cortas, mayúsculas y prueba varias semillas. Si no, añade el texto en postproducción.
¿Puedo entrenar mis propios modelos?
Sí, con LoRAs o ajustes finos (fine-tuning). Requieren más VRAM y tiempo. Para la mayoría de tareas, basta con buenos prompts y RAG.
¿Cómo versiono mis proyectos?
Anota: nombre del modelo, tamaño, cuantización, semilla, pasos y fecha. Guarda las plantillas de ComfyUI y los prompts junto al resultado.
¿Qué hago si todo se congela?
Cierra apps que usan GPU, reinicia el servicio de Ollama, baja el tamaño del modelo, reduce contexto o resolución. Vuelve a probar.
Con esto tienes un camino claro para ejecutar modelos de IA en local y construir tu propio “ChatGPT en tu PC” con privacidad total. Empieza hoy, mide, ajusta y escala. Consulta la referencia de Xataka para más detalles.
