Compartir
Portada de Aleph: un estudio de IA generativa 100 % local
Logo de Aleph: un estudio de IA generativa 100 % localProyecto ia · localcomfyui

Aleph: un estudio de IA generativa 100 % local

Un estudio multimodal que corre entero en tu ordenador: imagen, vídeo, audio para vídeo y voz en una sola página local.

25 ago 20264 minde lectura
Tipo
App local
Dependencias
0
Modelos
~40 GB
VRAM
8 GB
año
2026

Qué es Aleph

Aleph es un estudio de IA generativa que funciona por completo en local: genera imagen, vídeo, banda sonora para vídeo y voz desde una sola página web servida en 127.0.0.1, sin nube, sin cuentas y sin que ningún dato salga de la máquina. Por debajo unifica dos mundos: ComfyUI como motor de imagen y vídeo, y modelos de HuggingFace ejecutados en subprocesos propios. El nombre viene del Aleph de Borges: un punto que contiene todas las imágenes. La misma idea, aplicada a modelos de lenguaje: DRAGO Model Runner.

Texto a imagen

FLUX.2 Klein 9B con imágenes de referencia encadenables, o Pony Diffusion V6 XL como alternativa SDXL.

Texto e imagen a vídeo

Wan 2.2 TI2V-5B genera MP4 a 24 fps desde un prompt, o animando cualquier imagen como fotograma de partida.

Vídeo a audio

MMAudio compone una banda sonora para un vídeo subido y devuelve el vídeo recompuesto con su pista de audio.

Texto a voz

Qwen3-TTS CustomVoice con 10 idiomas, 9 voces y un campo de instrucción libre para controlar el tono.

Monitor de sistema

GPU con VRAM, temperatura y potencia; CPU con una barra por núcleo; RAM, swap y disco, refrescado cada 2 segundos.

Galería y prompts

Todas las salidas en una rejilla unificada, con biblioteca de prompts reutilizables y encadenado de imagen a vídeo en un clic.

Capturas reales (versión MODELOS Studio: imagen y vídeo, sin voz)

Texto a imagen con FLUX.2 Klein 9B

Texto a imagen con FLUX.2 Klein 9B

Imagen a vídeo con Wan 2.2

Imagen a vídeo con Wan 2.2

Generando: GPU al 100 %

Generando: GPU al 100 %

Galería de resultados

Galería de resultados

Voz generada en local con Qwen3-TTS

Siete segundos generados en este ordenador con el mismo modelo de voz que usa Aleph.

Flujo de una generación

  1. Elegir una capacidad en la barra lateral; solo aparecen las que tienen sus modelos en disco.
  2. Rellenar el formulario, que se genera solo a partir del catálogo declarativo.
  3. Lanzar el trabajo; el navegador sondea su estado cada 2 segundos con cancelación real.
  4. Ver el resultado en el panel derecho y en la galería, listo para descargar o animar en vídeo.

Un servidor sin una sola dependencia

El backend web usa exclusivamente la librería estándar de Python: ni Flask, ni FastAPI, ni siquiera requests. Hasta el parseo de formularios multipart está escrito a mano en veinte líneas. No es purismo: al no importar torch en el proceso del servidor, arrancar Aleph es trivial y liberar memoria gráfica es tan fiable como matar un subproceso. La app pesa menos de 350 KB de código propio frente a los ~40 GB de modelos que orquesta.

Cómo caben los modelos en 8 GB

Nada de esto cabría en una GPU de portátil con los pesos originales. Los modelos grandes van cuantizados: FLUX.2 Klein 9B y Wan 2.2 en GGUF Q6_K, el codificador de texto de FLUX (Qwen3 8B) en fp8 y el de Wan (UMT5-XXL) en GGUF Q5_K_M. ComfyUI arranca con --lowvram, que reparte los modelos entre la VRAM y la RAM del sistema. El precio se paga en tiempo: la primera generación de cada sesión es lenta porque carga los pesos, y un segundo de vídeo a 704×480 cuesta alrededor de minuto y medio.

No todo cupo. SCAIL-2, un modelo de animación de personajes por pose, se descartó tras investigarlo: sus pesos publicados son un checkpoint de entrenamiento de 65,6 GB sin versión cuantizada, inviable en 8 GB.

Una interfaz que se dibuja sola

El frontend no tiene ni un formulario escrito a mano: cada capacidad se declara como datos en un catálogo (categoría, motor, campos con su tipo) y la web lo convierte en interfaz con ocho tipos de campo. Añadir un modelo nuevo no toca ni una línea de HTML. Los campos pueden depender del modelo elegido: las imágenes de referencia solo aparecen si el modelo activo las admite.

El panel de sistema

Generar en local con 8 GB de VRAM significa vivir pendiente del hardware, así que Aleph lo enseña todo: uso y temperatura de la GPU, potencia en vatios, VRAM, veinte barras de CPU (una por núcleo), memoria y disco, más una tarjeta con lo que está trabajando en cada momento. Todo leído directamente del sistema, sin agentes externos, y siempre visible en una barra compacta inferior.

Galería y encadenado

Las salidas de todos los motores acaban en una galería única, clasificadas por tipo y ordenadas por fecha, con los vídeos reproduciéndose al pasar el ratón. Cualquier imagen —recién generada o antigua— tiene un botón de animar en vídeo que la recoloca como fotograma de partida de Wan 2.2, sin pasos intermedios.

La prueba que salió mal

El diseño más ambicioso de Aleph era un segador de VRAM: matar automáticamente los subprocesos de modelo tras 90 segundos de inactividad para devolver la memoria a ComfyUI. El código existe y parece correcto, pero la única prueba conservada dice otra cosa: la VRAM se quedó en ~4,5 GB y no bajó ni pasados 37 minutos. Se guardó el resultado fallido tal cual, y ahí sigue.

“Hecho para funcionar en local, para ti. Tus datos, tus modelos y tus creaciones no salen de tu ordenador.”
— Documentación del proyecto

Estado real

Aleph se escribió en una tarde de julio de 2026 y quedó terminado como versión 1: unas 3.800 líneas propias, 4 capacidades, 5 modelos y 12 rutas de API, verificado con salidas reales de voz e imagen. También tiene deudas claras: no hay barra de progreso real para imagen y vídeo (solo un cronómetro), la semilla no es controlable desde la interfaz —no se puede repetir una generación buena—, no hay tests y solo funciona en Linux con GPU NVIDIA.

La versión publicada en el repositorio referencia los pesos por ruta absoluta, una decisión deliberada que se rompe si el directorio de modelos cambia de nombre; hacerla configurable con una variable de entorno es el siguiente arreglo.

Ámbito

Aleph escucha solo en 127.0.0.1 y no tiene autenticación: está pensado para un solo usuario en su propia máquina, no para exponerse a la red. Requiere Linux y GPU NVIDIA.

Materiales / Compra

Tienda: Motor de imagen y vídeo: ComfyUI con los modelos FLUX.2 Klein 9B, Pony Diffusion V6 XL, Wan 2.2 TI2V-5B y MMAudio 44k. Voz: Qwen3-TTS 12Hz 1.7B CustomVoice de HuggingFace. Hardware de referencia: un portátil con RTX 5060 de 8 GB de VRAM.

Aprendizajes

La lección central: con 8 GB de VRAM y dos motores compitiendo, la arquitectura la dicta la memoria. Separar el servidor (sin torch, solo librería estándar) de los modelos (subprocesos matables) hizo el sistema simple y robusto; y la parte que falló —la liberación automática de VRAM— quedó documentada con su prueba, porque un resultado negativo guardado vale más que una promesa.