Ejecuta IA en local: tu portátil como primer proveedor personal de IA

Sin conexión a ninguna red, un portátil responde a una pregunta. A continuación, otra aplicación del mismo equipo le hace exactamente la misma pregunta y también obtiene respuesta, sin que tengas que cambiar nada. Esa segunda consulta convierte el portátil que ya usas en un pequeño proveedor personal de IA al que otras aplicaciones y scripts pueden enviar peticiones.

Aquí aprenderás a ejecutar un modelo descargado, no a entrenarlo. Si aún no has comprobado si tu portátil tiene suficiente RAM o VRAM para ello, lee primero cuánta RAM necesita tu portátil para ejecutar IA local. Si ya sabes que cumple los requisitos, sigue leyendo.

Las cuatro capas de una instalación de IA local

Toda instalación de IA local tiene cuatro capas, aunque la cuarta es opcional. Si sabes qué hace cada una, te resultará más fácil seguir los pasos de esta guía.

Los pesos del modelo son el archivo que descargas. Por ejemplo, una versión cuantizada de un modelo pequeño ocupa 3,4 GB. Esa cifra indica cuánto ocupa el archivo en el disco, no cuánta RAM necesitará el modelo al ejecutarse.

El motor de inferencia es el programa que carga esos pesos y responde a las peticiones. En esta guía usamos Ollama, que tiene su propia API HTTP local. Gracias a esta capa, el portátil puede atender las peticiones de otras aplicaciones.

La interfaz envía la petición: puede ser el chat integrado de Ollama, un script corto u otra aplicación. Es la que determina si la consulta se queda en el portátil o se envía a otro lugar.

Un índice de documentos opcional permite a un modelo de chat buscar en tus archivos. Para ello, necesita un modelo aparte que genere embeddings y un espacio de almacenamiento propio. El índice no se crea automáticamente y queda fuera de esta guía.

En pocas palabras: una aplicación o un script envía una petición a 127.0.0.1:11434, la dirección de Ollama. El programa carga el modelo que has descargado. Borrar ese modelo no elimina el historial de conversaciones que haya guardado la interfaz: se almacenan en lugares distintos.

Antes de instalar: ¿se parece tu portátil a alguno de estos dos?

Antes de instalar nada, dedica dos minutos a anotar los datos de tu portátil: cuánta RAM tiene, qué sistema operativo usa, qué procesador lleva, cuánta memoria gráfica dedicada (VRAM) tiene, si dispone de ella, y cuánto espacio libre queda en el SSD. Para entender en detalle cuánta RAM y VRAM necesita la IA local, consulta cuánta RAM necesita tu portátil para ejecutar IA local.

Los dos portátiles que aparecen a continuación están disponibles actualmente en refurbed. Ambos están reacondicionados: profesionales los han probado, limpiado y puesto a punto, y cuentan con una garantía de 12 meses. Uno es un modelo de gama de entrada de Apple con chip Apple Silicon; el otro, un portátil con Windows y memoria gráfica dedicada. Con cualquiera de los dos puedes seguir todos los pasos de esta guía.

Instala Ollama en macOS, Windows o Linux

En macOS o Windows, instala la aplicación oficial de Ollama; en Linux, sigue sus instrucciones de instalación. Después, abre Ollama. En Linux, ejecuta ollama serve si el servicio aún no está a la escucha.

La versión actual de Ollama permite usar modelos en local y también ofrece opciones en la nube. Elige la etiqueta del modelo local que vas a descargar: no necesitas iniciar sesión para ejecutarlo en tu equipo.

Para seguir esta guía, descarga este modelo en concreto: qwen3.5:4b-q4_K_M (3,4 GB). Usa la etiqueta exacta: una genérica como «latest» puede apuntar, sin que te des cuenta, a un modelo mucho más grande que el que has probado. Esos 3,4 GB corresponden al tamaño de la descarga en el disco, no a un requisito de RAM: no indican cuánta memoria necesitará el modelo al responder a las peticiones.

Descarga tu primer modelo y empieza a chatear

Dos comandos bastan para empezar a chatear con el modelo:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

El primero descarga el modelo; el segundo abre un chat interactivo. En vez de limitarte a saludar, pídele que haga una tarea pequeña que tengas pendiente. Por ejemplo: «Convierte estas tres notas de reunión en una lista de tareas. No inventes fechas».

Cuando termines, escribe /bye para salir del chat.

Llama a la API: tu portátil ya ejecuta IA en local

Al chatear en el terminal, la interfaz se comunica con el motor. Ahora toca enviarle una petición directamente, como haría otra aplicación.

En macOS o Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

En Windows, desde PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Busca message.content en la respuesta. Con stream en false, recibirás la respuesta completa de una vez, en lugar de recibirla por fragmentos. Al fijar num_ctx: 4096, eliges un tamaño de contexto moderado para esta primera prueba, muy por debajo del máximo anunciado para el modelo.

Qué datos aporta la respuesta

Además del texto generado en message.content, Ollama devuelve otros campos que conviene revisar para entender los tiempos: load_duration, prompt_eval_count, prompt_eval_duration, eval_count y eval_duration.

Con esos campos puedes distinguir el tiempo de carga del modelo en memoria del tiempo de generación de la respuesta, algo que una sola cifra de «tokens por segundo» no permite. La primera petición tras iniciar Ollama suele ser la más lenta porque incluye la carga del modelo, que la siguiente ya no necesita.

Las cifras concretas dependen por completo de tu equipo, así que aquí no damos ninguna como valor habitual. Compara esos campos en dos pruebas con el mismo portátil, en vez de fiarte de un dato de velocidad aislado.

Modelos cargados: ps, ls y liberación de memoria por inactividad

Para las tareas básicas, bastan tres comandos.

ollama ps muestra qué modelos están cargados y dónde se ejecutan: la columna del procesador indica 100 % GPU, 100 % CPU o un reparto entre ambas.

ollama ls enumera todos los modelos que has descargado.

ollama rm qwen3.5:4b-q4_K_M borra un modelo descargado que ya no necesitas.

Por defecto, Ollama libera de memoria un modelo tras cinco minutos de inactividad. Si ollama ps no muestra ningún modelo cargado, envía una petición más antes de dar por hecho que algo falla.

Conecta una segunda aplicación a la API local compatible con OpenAI

Ahora tu portátil puede atender las peticiones de una segunda aplicación, además de las que recibe en el chat de Ollama. Configúrala para que se conecte al mismo equipo, no a un servicio en la nube.

La mayoría de las aplicaciones que permiten configurar un punto de conexión compatible con OpenAI te piden tres datos: una URL base, el nombre del modelo y una clave de API. Indica http://localhost:11434/v1/ como URL base y qwen3.5:4b-q4_K_M como nombre del modelo.

La clave de API puede despistar: algunas aplicaciones no permiten dejar el campo en blanco. Por eso, Ollama usa api_key='ollama' como valor de relleno en su documentación y aclara que el servidor local exige un valor no vacío, pero no comprueba cuál. Esa cadena solo sirve para rellenar el campo del formulario: no autentica nada ni es una contraseña.

La compatibilidad solo abarca una parte de cada API. Prueba con tu aplicación las funciones que quieras usar, como la entrada de imágenes o las llamadas a herramientas, antes de dar por hecho que funcionan.

Compruébalo sin conexión: repite la consulta

Hasta ahora, las consultas podrían haber salido a internet sin que te dieras cuenta. Para descartar esa posibilidad, haz esta prueba.

Una vez descargado el modelo, desactiva el wifi del portátil o desenchufa el cable de red. Repite la consulta anterior en el chat o a través de la API. Si obtienes una respuesta sin conexión alguna a internet, queda demostrado que el modelo se ejecuta en local.

No sirven como prueba las respuestas que solo recibes cuando tienes conexión, las que proceden de https://ollama.com en vez de localhost ni las obtenidas con la etiqueta de un modelo en la nube en vez de uno descargado. Las peticiones a los modelos locales de Ollama se quedan en tu equipo; sus modelos en la nube, ofrecidos por separado, reciben las consultas por otra vía y se ejecutan en servidores externos.

Cómo mantener privada tu instalación de IA local

No es casualidad que esta instalación sea privada: conviene saber qué te protege y qué no.

Por defecto, Ollama solo escucha en 127.0.0.1:11434: únicamente tu portátil puede conectarse a él. Mantén esa configuración. No configures OLLAMA_HOST=0.0.0.0 ni redirijas el puerto 11434 a internet: la clave de API de relleno de la sección anterior no autentica el acceso. Si expones el puerto, dejas la puerta abierta en vez de cerrarla con llave.

Si quieres desactivar por completo las funciones en la nube de Ollama, puedes hacerlo, aunque no es necesario: basta con elegir la etiqueta de un modelo local descargado para ejecutarlo en tu equipo. Añade {"disable_ollama_cloud": true} al archivo ~/.ollama/server.json o configura OLLAMA_NO_CLOUD=1. En ambos casos, reinicia Ollama para que el cambio se aplique.

Para acceder a esta instalación desde otra habitación u otro dispositivo, necesitas una red privada y un proxy que exija autenticación. Es otro asunto, más avanzado, que queda fuera de esta guía; exponer el puerto directamente no es la forma de hacerlo.

Si algo falla

Estos son los problemas más habituales y lo primero que conviene revisar en cada caso.

Conexión rechazada. Comprueba que la aplicación de Ollama o ollama serve esté en marcha y vuelve a intentarlo.

La primera respuesta tarda; las siguientes, menos. Se debe al tiempo de carga del modelo, no a la velocidad de generación. Consulta los campos de la respuesta que vimos antes para distinguir ambas cosas.

Todo parece ir mucho más lento de lo esperado. Ejecuta ollama ps: puede indicar que el modelo solo usa la CPU o que reparte la carga entre la CPU y la GPU. Comprueba la compatibilidad de tu GPU y sus controladores con tu sistema operativo.

La memoria va justa o hay cierres inesperados. Cambia a la etiqueta de un modelo más pequeño, reduce num_ctx y cierra otras aplicaciones que consuman mucha memoria antes de volver a intentarlo.

El disco se está llenando. Ejecuta ollama ls para ver qué modelos tienes descargados y borra los que no utilices con ollama rm.

Si esta solución no te encaja, quizá porque prefieres explorar modelos con una interfaz gráfica o controlar la CPU y la GPU con más precisión, merece la pena echar un vistazo a LM Studio y llama.cpp. Son alternativas para cambiar de motor, no para mantener dos instalaciones funcionando a la vez.

Preguntas frecuentes sobre la IA local en tu portátil

¿Necesito internet después de la instalación? No. Una vez descargado el modelo, puedes chatear con él y llamar a la API sin conexión a internet.

¿La clave de API de relleno protege el acceso? No. El servidor local de Ollama acepta cualquier valor no vacío sin verificarlo, así que la clave que piden algunas aplicaciones no es una medida de seguridad.

¿Mis consultas se quedan en mi portátil? Sí, si eliges la etiqueta de un modelo local descargado. Ollama también ofrece otros modelos en la nube, que se ejecutan en servidores externos. La diferencia está en la etiqueta que elijas, no en una opción predeterminada oculta.

¿Necesito una tarjeta gráfica dedicada? No. Un portátil que solo use la CPU puede ejecutar un modelo pequeño, aunque normalmente lo hará más despacio. ollama ps muestra exactamente cómo se ha procesado cada petición.

¿Y si quiero un modelo más grande o distinto? Sustituye la etiqueta en los mismos comandos ollama pull y ollama run, pero comprueba antes la RAM y la VRAM. Consulta cuánta RAM necesita tu portátil para ejecutar IA local para ver la explicación completa.

¿Recordará mis documentos a partir de ahora? No. Un modelo de chat no memoriza por sí solo el contenido de una carpeta de forma permanente. Para buscar en tus archivos necesitas un índice de documentos independiente, una configuración opcional que no tratamos aquí.

Ahora te toca poner a trabajar tu proveedor personal de IA

Elige una tarea real y pruébala en los dos clientes que ya tienes: el chat integrado y la aplicación que acabas de conectar. Por ejemplo, puedes pedirle al modelo que resuma una nota personal, clasifique un lote de archivos en grupos etiquetados o te explique con palabras sencillas un fragmento breve de código.

Elijas lo que elijas, anota la etiqueta exacta del modelo, la versión del motor, la configuración del contexto, la URL y en qué consistía la tarea. Así podrás reproducir el resultado más adelante, igual que cualquier otra persona que quiera hacer la misma prueba.

Si has comprobado que tu portátil se queda corto de RAM o VRAM para esto, merece la pena plantearse cambiarlo por uno con más margen. En la próxima entrega de esta serie veremos cómo reunir un pequeño repertorio de modelos: uno para chatear, otro para programar y otro para buscar.

Portátil reacondicionado apto para ejecutar IA en local, disponible en refurbed

¡Suscríbete a nuestro boletín por primera vez y ahorra 15 €!

No vuelvas a perderte ninguna oferta.

Encontrarás información sobre el uso de datos personales en nuestra Política de privacidad.