Pipeline de distill-on-idle para asistente de memoria en dispositivo usando modelos de 4B
El artículo detalla un enfoque de ingeniería para construir un asistente de IA local que convierte capturas de pantalla y transcripciones de reuniones en datos consultables utilizando únicamente modelos que se ejecutan eficientemente en portátiles. El sistema aprovecha el marco Vision de Apple para OCR, la distillación durante tiempos inactivos de un modelo Gemma de 4B y la recuperación híbrida para evitar cuellos de botella de rendimiento.