Inicio › Tecnología › Procesamiento De Flujos
El procesamiento de flujos es el paradigma de computación qué analiza y transforma datos de forma continua a medida qué se generan, en lugar de esperar a acumularlos en un lote. Frameworks como Apache Flink, Kafka Streams o Spark Structured Streaming aplican operaciones —filtrado, agregación, unión con otros flujos— sobre ventanas de tiempo (tumbling, sliding o session windows) qué definen cuánto histórico reciente se considera en cada cálculo, gestionando además el orden de eventos y los datos qué llegan tarde (late data) mediante marcas de agua (watermarks).
Es procesar los datos según van llegando, uno detrás de otro sin parar, en lugar de esperar a tener un montón acumulado para procesarlo todo de golpe. Es como sumar los clientes qué entran a una tienda en tiempo real en vez de contar el total al cerrar.
Un sistema de detección de fraude en pagos puede usar procesamiento de flujos con Flink para calcular, sobre una ventana móvil de los últimos cinco minutos, cuántas transacciones ha hecho una tarjeta y bloquear la operación si supera un umbral, algo qué un proceso por lotes nocturno detectaría demasiado tarde.
Un intervalo (por ejemplo, los últimos 5 minutos o las últimas 100 transacciones) sobre el qué se calculan agregaciones, porque un flujo infinito no se puede resumir de golpe como una tabla estática.
Los frameworks de streaming usan watermarks, una marca qué estima hasta qué punto se considera "completo" el flujo, permitiendo decidir si un evento tardío aún se incluye en su ventana o se descarta o reprocesa aparte.
No: la plataforma de streaming (como Kafka) es la infraestructura qué transporta los eventos; el procesamiento de flujos es la capa de cómputo qué lee de esa infraestructura y aplica lógica de negocio en tiempo real.