Resumen
pin-S es un sistema personal que transforma notas de voz capturadas con un dispositivo de muñeca en una base de conocimiento estructurada, y sobre esa base ejecuta tres funciones progresivas: organiza (agenda, tareas, ideas), modela (extrae principios y razonamientos recurrentes) y cuestiona (produce crítica propositiva contrastada contra la memoria acumulada).
Todo el cómputo corre local, a costo cercano a cero y sin dependencia de la nube de terceros. El pipeline está desacoplado en etapas idempotentes, orquestadas por cron. Este documento describe la arquitectura, las decisiones de diseño y la evidencia académica y de mercado que las respalda.
El sistema mantiene una memoria estructurada y creciente —notas interconectadas por significado—, con síntesis automática de principios y un módulo de crítica con registro de aprendizaje propio.
1. Problema
La captura de ideas tiene un cuello de botella conocido: la fricción. Una idea que aparece fuera del escritorio —manejando, caminando, en medio de otra cosa— rara vez sobrevive hasta un momento de registro. El resultado es una pérdida silenciosa y continua de material cognitivo.
Los sistemas comerciales de captura por voz con IA (Plaud, Limitless, Bee, Omi) resuelven bien la captura y el resumen, pero se detienen en el patrón capturar → transcribir → resumir → recuperar. Ninguno modela cómo decide el usuario ni ejerce crítica sobre sus decisiones. pin-S parte de ese patrón como piso, no como techo.
2. Arquitectura general
El principio de diseño es etapas desacopladas: cada una lee de una carpeta y escribe en la siguiente. Son idempotentes y re-ejecutables; si una falla, se retoma desde su carpeta de entrada sin rehacer lo anterior.
Plaud (nube) --CLI--> _entrada/ --transcribe--> _transcripciones/ --Claude--> vault/
(Spokenly - faster-whisper - Scribe) |
+-- Tareas/ -> Google Tasks
+-- Eventos/ -> Google Calendar
+-- Razonam./ -> sintesis -> Forma de pensar/
+-- Criticas/ -> sparring -> email (por ID)
+ capa semantica (embeddings locales) transversal
+ orquestacion por cron cada 2 h
2.1 Captura
El hardware es un Plaud NotePin en formato de muñeca. Decisión de diseño clave: el sistema trabaja únicamente con el audio crudo que exporta el plan gratuito, e ignora deliberadamente la transcripción paga de Plaud. La captura debe costar un gesto; todo lo demás se construye puertas adentro.
2.2 Transcripción — cadena de respaldo local-primero
Cada audio atraviesa una cadena que se detiene en el primer motor que devuelve texto útil:
- Spokenly (local, con diarización por hablante).
- faster-whisper (local) — rescata clips cortos que el VAD de Spokenly descarta.
- ElevenLabs Scribe (de pago) — última red, solo si los dos motores locales fallan.
Sobre esta cadena hay un escalado por calidad: los audios más largos o complejos se re-transcriben con un motor de diarización de grado superior cuando hace falta. Si ningún motor produce texto, el audio se conserva y el runner emite una alerta: nunca falla en silencio.
2.3 Segmentación y clasificación
Una transcripción puede contener varios temas. Un proceso con Claude segmenta por tema, clasifica cada segmento en un conjunto abierto de categorías y rellena la plantilla correspondiente. La salida son notas Markdown en el vault con front-matter (fecha, categoría, origen, enlaces).
2.4 Memoria: vault + capa semántica
El vault es una bóveda de Obsidian; los enlaces explícitos construyen el grafo navegable. Encima corre una capa semántica de embeddings locales que conecta notas por significado —no solo por palabra exacta ni enlace manual—, resolviendo el recall difuso ("¿qué pensaba sobre X?"). Degrada con gracia: si el índice no está disponible, cae a búsqueda por texto.
2.5 Salidas accionables
Las categorías operativas se enrutan a canales externos: tareas a Google Tasks, eventos a Google Calendar, y las críticas del sparring por email. La doctrina de ejecución es procesar-y-marcar: el pipeline no se detiene ante la duda; lo dudoso se señala en una cola de revisión.
2.6 Síntesis de forma de pensar
Una segunda pasada consolida los razonamientos extraídos (decisión + porqué, criterios) en principios recurrentes. Un principio pasa de emergente a consolidado al acumular evidencia suficiente. Guard central de esta etapa: se pesa la conducta por encima de la declaración — consolidar un principio exige evidencia de decisiones, no de declaraciones. Lo que el usuario hace vale más que lo que dice sobre cómo piensa.
2.7 Sparring crítico
El módulo diferencial. Un tercer proceso, post-síntesis, produce crítica sobre las categorías con carga de decisión (ideas y razonamientos). Antes de opinar, rastrea la trama: decisiones previas, principios consolidados y críticas anteriores. La crítica sigue una estructura fija —qué veo / por qué me preocupa / qué alternativa propongo— y llega por email con un ID único que permite abrir un diálogo posterior.
Dos propiedades lo separan de un "resumidor con opinión":
- Rúbrica explícita de intervención: solo dispara ante riesgo financiero, pérdida de tiempo, erosión de un principio consolidado, contradicción o error factual. Silencio por defecto.
- Registro de aprendizaje propio: el crítico anota si su aviso fue seguido y qué ocurrió después. Lee ese registro antes de criticar, y sube la intensidad en los puntos ciegos donde fue ignorado y acertó.
3. Decisiones de diseño y su fundamento externo
El diseño de pin-S se apoyó explícitamente en investigación de mercado y académica. Las decisiones no triviales y su justificación:
3.1 Local y a costo cero, por diseño
La adquisición de Limitless por Meta (dic. 2025, producto discontinuado) y de Bee por Amazon (jul. 2025) confirmaron el riesgo de depender de un tercero para la memoria personal. La arquitectura local de pin-S —cómputo en la propia máquina, sin subscripción, con control total del dato— es una respuesta directa a ese riesgo, no una preferencia estética.
3.2 Separación episódica / semántica
La ciencia cognitiva (Tulving, 1972) y las arquitecturas de agentes (CoALA) distinguen memoria episódica (qué pasó, cuándo) de semántica (qué principios valen en general). Los benchmarks muestran que el RAG puro falla en razonamiento temporal. pin-S materializa esa distinción: notas episódicas fechadas versus principios consolidados.
3.3 Crítica con rúbrica, no auto-reflexión genérica
La evidencia sobre self-correction (Huang et al., 2023) es clara: un LLM no se autocorrige bien sin feedback externo o rúbrica concreta; "revisar" a ciegas suele empeorar el razonamiento. Constitutional AI funciona porque verifica contra una rúbrica textual, no por reflexión difusa. De ahí que la crítica de pin-S opere con criterios explícitos, no con un prompt genérico de "criticá esto".
3.4 Blindaje anti-sycophancy
El efecto FlipFlop (Laban et al., 2023) documenta que los LLM cambian su respuesta ~46% de las veces ante un simple "¿estás seguro?", con caída de ~17% en accuracy. Un sparring partner que se retracta bajo presión es inútil. Por eso, ante un cuestionamiento del usuario, pin-S no se retracta por defecto: re-ancla en la evidencia del vault y solo cambia ante un argumento genuinamente nuevo.
3.5 El valor de la fricción, con condiciones
El respaldo experimental del "abogado del diablo" es sólido pero condicional. El meta-análisis de Schwenk (1990) muestra que la crítica estructurada mejora la calidad de las decisiones; el estudio de Chiang et al. (IUI 2024, 350 participantes) precisa que el efecto positivo aparece solo cuando la crítica es interactiva y apunta a lo que importa. Un hallazgo contraintuitivo de ese trabajo guía el diseño: quienes mejor rindieron reportaron la menor percepción de su propio desempeño — la fricción útil se siente incómoda. pin-S asume esa incomodidad como señal de funcionamiento, no de falla. El marco de Antagonistic AI (Cai et al., Harvard) aporta el límite: desafiar con consentimiento, contexto y framing.
3.6 Privacidad y postura de seguridad
El diseño local-primero no es solo una decisión de costo: reduce la superficie de exposición. El material sensible no viaja a servicios de terceros; el egreso externo se mantiene al mínimo indispensable. El audio se descarta una vez transcripto, y el contenido marcado como privado queda fuera de los índices y de cualquier sincronización. La seguridad efectiva del sistema descansa, en última instancia, en la del entorno donde corre.
4. Estado actual
- Vault: memoria estructurada y creciente, interconectada por enlaces, con separación explícita entre notas episódicas y principios consolidados.
- Automatización: corrida periódica automática, con catch-up al encender la máquina.
- Síntesis: extracción y consolidación de principios operativa, con guard decisión-vs-declaración.
- Sparring: ciclo crítica → email → diálogo por ID → veredicto, con registro de aprendizaje activo.
5. Límites conocidos y trabajo futuro
- Memoria temporal bi-temporal: los grafos temporales (Zep/Graphiti; Zep reporta 94,8% en el benchmark DMR, por encima de MemGPT) resuelven la detección automática de contradicciones y las consultas point-in-time mejor que la búsqueda por texto. Es la evolución natural de la capa de memoria, con la contrapartida de mayor mantenimiento.
- Grounding académico bajo demanda: la crítica podrá apoyarse no solo en la historia propia, sino en bibliotecas de referencia curadas por el usuario (papers, autores, marcos de interés) que sustenten cada proposición.
- Outcome tracking: check-ins diferidos (30/60/90 días) para calibrar cuándo la crítica agregó valor real.
- Umbral de intervención cuantificado: score de severidad × confianza × irreversibilidad para decidir qué se envía y qué se agrupa en una revisión semanal.
6. Stack técnico
Captura: Plaud NotePin · Transcripción: Spokenly, faster-whisper, ElevenLabs Scribe · Inteligencia: Claude / Claude Code · Memoria: Obsidian, embeddings locales · Salidas: Google Tasks, Google Calendar, Gmail · Infraestructura: Python, cron, git · Cómputo: máquina local (macOS).
7. Cierre
pin-S no busca delegar el pensamiento, sino aumentarlo. La automatización de lo operativo libera tiempo; la síntesis de principios devuelve una imagen del propio criterio; la crítica calibrada introduce la fricción que, según la evidencia, mejora las decisiones. El objetivo de ingeniería y el objetivo personal coinciden en una sola métrica: pensar mejor, no pensar menos.
pin-S es un proyecto personal de Emiliano Lembo, broker principal de niddo. Refleja la misma forma de trabajar que aplicamos en la inmobiliaria: método, criterio y decisiones fundamentadas.