Datos de entrenamiento y la brecha de juicio
Por qué el próximo salto en la calidad del modelo no vendrá de más tokens, sino de más desacuerdo — y cómo obtener el tipo correcto de desacuerdo de los expertos.
Blog
Ensayos sobre datos de entrenamiento, calidad, procesos y el trabajo práctico de construir IA fiable.
Últimas publicaciones
Uno o dos ensayos a la semana de nuestro equipo y expertos senior.
Por qué el próximo salto en la calidad del modelo no vendrá de más tokens, sino de más desacuerdo — y cómo obtener el tipo correcto de desacuerdo de los expertos.
Las rúbricas son cómo hacemos que el juicio sea enseñable. También son lo más fácil de sobre-diseñar. Un breve ensayo sobre la línea entre la calibración y la burocracia.
Un desglose de cómo establecemos tarifas: señales del mercado, intereses del proyecto, multiplicadores de nivel y las decisiones deliberadas que tomamos para evitar dinámicas de carrera hacia el fondo.
Cómo estructuramos programas de equipos de ataque para modelos de razonamiento clínico: control de acceso, bienestar, rutas de escalada y los protocolos que mantienen el trabajo adversarial seguro.
Los anotadores generalistas tienen un límite. Abogamos por una división más clara: especialistas en la materia para el contenido, lingüistas para el tono, revisores calibrados para ambos.
Qué cambió cuando obligamos a cada tarea aceptada a llevar una nota de rúbrica de vuelta al experto. Spoiler: la tasa de disputas disminuyó, la progresión de niveles se aceleró.
¿Tienes algo que decir?
Se aceptan publicaciones de invitados de expertos de Lona y profesionales serios.