Hola a todos, soy Ning Fan.
Fan Fan recientemente se topó con un grupo de números y realmente se está inquietando. En mayo de 2026, Epoch AI lanzó un informe: los modelos de lenguaje grandes podrían agotar todos los datos de texto público en Internet entre 2026 y 2032. Mientras tanto, el informe del Instituto de Telecomunicaciones de China es aún más radical, prediciendo que en 2026 el entrenamiento de modelos de lenguaje grandes podría limpiar todos los datos de texto disponibles.
Esto no es un escenario de ciencia ficción lejano, esto es lo que está pasando. La industria de la IA no solo enfrenta demandas por derechos de autor: el 5 de mayo, Elsevier se unió a cinco grandes editoriales para demandar a Meta, acusando a Llama de entrenar con libros pirateados a gran escala; la crisis más profunda es que los datos de alta calidad están llegando a su fin. La data pública de Internet, esa rama baja, está a punto de ser despojada, mientras que los datos realmente valiosos en campos verticales—imágenes médicas, registros de transacciones financieras, jurisprudencia, parámetros industriales—están totalmente encerrados dentro de las instituciones, y la IA no puede acceder a ellos.
En palabras simples: la 'crisis alimentaria' de la IA ha llegado. Y no es que la comida se haya vuelto cara, es que la comida realmente se está agotando.
Esa es también la razón por la que FanFan ha estado observando @OpenLedger últimamente. Este proyecto no está contando la misma vieja historia de un 'GPT descentralizado', sino que ataca directamente desde la fuente de datos — esa es su estructura de Datanets.
Datanets se puede entender como 'cooperativas de datos'. Por ejemplo, en el ámbito de imágenes médicas, se podría crear un Datanet específico donde médicos, hospitales e instituciones de investigación de todo el mundo carguen datos de imágenes desensibilizadas; los contribuyentes reciben recompensas en $OPEN según la calidad de los datos y las veces que son utilizados, y los desarrolladores de modelos pagan para acceder a estos conjuntos de datos de alta calidad verificados para entrenar modelos específicos. En finanzas, manufactura y contratos legales, cada sector puede crear su propio Datanet y liberar esos 'datos oscuros' atrapados en instituciones.
FanFan considera que la razón por la que esta lógica funciona es que ha roto un tabú. Ahora hay una cantidad masiva de datos de alta calidad, pero estos están atrapados en 'islas de datos' — los estándares entre instituciones no se comunican, los formatos de datos no son uniformes y casi no hay mecanismos para compartir entre plataformas. Lo que OpenLedger busca no es recoger datos, sino proporcionar una infraestructura que permita a cualquier comunidad 'auto-organizarse' en torno a datos de áreas específicas.
Su arma principal es el Proof of Attribution (Prueba de Atribución) del que FanFan ha hablado antes, pero hoy quiere cambiar de enfoque y verlo desde la perspectiva de la 'cadena de suministro de datos'.
En el entrenamiento tradicional de IA, el origen de los datos, quién los manipuló, cómo fueron procesados y cómo afectaron a la salida del modelo es un completo lío. Los contribuyentes de datos son comprados de una sola vez, y el modelo gana dinero sin tener nada que ver con los proveedores de datos.
En OpenLedger, cada dato es anclado en la cadena con un hash desde el momento de su carga, todo el proceso de etiquetado y verificación queda registrado, los registros de entrenamiento del modelo y las referencias del conjunto de datos se suben a la cadena, y al momento de la inferencia, el motor de atribución rastrea automáticamente qué puntos de datos hicieron la mayor contribución, y luego reparte las recompensas a través de contratos inteligentes. Los contribuyentes de datos no son comprados, sino que poseen 'acciones de datos' — mientras tu dato siga en uso, seguirás generando ingresos.
Todo este proceso, OpenLedger lo llama 'canal de datos verificables'. FanFan le pone un nombre más coloquial: la 'cadena de suministro de datos al sol'. Desde la recolección hasta la limpieza, verificación y transmisión, cada etapa es auditable en la cadena, cualquier contaminación maliciosa de datos o datos de origen desconocido se puede detectar de inmediato.
Además, OpenLedger no está solo en esta batalla. Junto con Story Protocol, han hecho un gran movimiento en enero de 2026 — lanzando un nuevo estándar para la liquidación de derechos de autor de datos de entrenamiento de IA y el pago automático a los creadores. ¿Cómo funciona? Story se encarga del registro de IP y la definición de términos de licencia, y OpenLedger se ocupa de la ejecución y verificación — cuando el contenido autorizado es utilizado en el entrenamiento, se verifica encriptadamente el uso de la IP, y automáticamente se paga a los titulares de derechos. Situaciones como la de Elsevier, donde se luchó hasta los tribunales, pueden no ocurrir en este sistema de OpenLedger.
Hablemos sobre la posición de OPEN en todo este tablero. FanFan ha revisado la posición de OPEN en el juego. Ha visto varios escenarios de uso de OPEN y se da cuenta de que no solo es un 'token de gobernanza' para engañarte — los contribuyentes de datos reciben recompensas en OPEN a través del motor de atribución, los desarrolladores de modelos registran y publican modelos usando OPEN como Gas, y los usuarios que llaman a la inferencia del modelo también pagan con $OPEN, una parte para el modelo, otra para los contribuyentes de datos upstream, y otra parte para el fondo de infraestructura pública. Todo este ciclo económico conectado es lo que OpenLedger llama 'IA pagable' — cada etapa de la IA tiene personas trabajando, y cada etapa tiene personas ganando, la actividad económica ya no es un juego monopolizado por gigantes.
FanFan siempre ha creído que la narrativa más atractiva de Web3 no es recrear un casino, sino usar la tecnología para resolver problemas del mundo real. La escasez de datos para IA no es alarmismo — si las relaciones de producción de datos no cambian, el techo de desarrollo de la IA es visible. No me atrevo a asegurar que OpenLedger sea el que rompa el estancamiento, pero al menos su propuesta ha empujado el tema de 'cómo se producen los datos y cómo se distribuyen las ganancias' un gran paso hacia adelante.
¿Qué piensan? ¿La escasez de datos realmente ha llegado o es solo alarmismo? ¿Puede realmente el dato descentralizado marcar la diferencia? Hablemos en los comentarios, ¡FanFan está en línea esperando! No olviden seguir @OpenLedger y $OPEN para la historia, ¡vamos comentando mientras miramos!
