Iceberg e camada semântica: AWS, Cloudflare, Microsoft e Google padronizam dados para IA

Capa do Watcher com o título A pilha de dados para IA se padroniza
Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI.

Entre 28 de setembro e 1º de outubro de 2026, AWS, Cloudflare, Microsoft, Google, Cohere e NetApp anunciaram peças que se encaixam na mesma pilha de dados para IA. Na base, o formato aberto de tabelas Apache Iceberg ganhou suporte completo à versão 3 no Amazon S3 Tables e virou o alicerce do Cloudflare Basin, que saiu do beta. Em cima, Microsoft e Google aderiram ao Apache Ossie, o padrão aberto para descrever métricas e modelos semânticos. Em volta, chegaram embeddings com contexto de 128 mil tokens e armazenamento de 100 TB/s para fábricas de IA.

Em resumo

  • Tabelas: S3 Tables passa a aceitar todos os tipos do Iceberg V3, e o Aurora PostgreSQL consulta Iceberg e Parquet direto do data lake, sem ETL.
  • Plataforma: Cloudflare Basin entra em disponibilidade geral sobre Iceberg e R2, aberto a DuckDB, Spark, Snowflake e Trino.
  • Semântica: Microsoft e Google entram no Apache Ossie, que já reúne mais de 60 empresas, e a Microsoft leva os modelos do Power BI ao Copilot.
  • Busca e armazenamento: Cohere lança o Embed 5 com 128 mil tokens de contexto, e a NetApp lança o Novus, com meta de 100 TB/s.
  • Ressalva: o Ossie ainda é rascunho em incubação na Apache, e portabilidade de formato não garante o mesmo resultado em cada ferramenta.

O que foi anunciado na camada de tabelas?

A AWS anunciou em 30 de setembro que o Amazon S3 Tables passa a suportar todos os tipos de dados do Apache Iceberg V3: variant (dados semiestruturados), timestamps em nanossegundos, geometry, geography e unknown. Vêm junto os deletion vectors, que substituem os arquivos de exclusão por posição, e a linhagem de linhas. Não há cobrança extra. Os novos tipos exigem motores com Apache Spark 4.0 ou superior, como AWS Glue 6.0 e Amazon EMR 8.1.

No mesmo dia, a AWS embutiu o DuckDB no Aurora PostgreSQL. O banco transacional passa a consultar tabelas Iceberg e arquivos Parquet no S3 e no S3 Tables com SQL comum de PostgreSQL, por tabelas externas, sem pipeline de ETL. Vale para as versões 17.11 e 18.6 em diante, em todas as regiões comerciais da AWS, sem cobrança além do processamento do Aurora e das requisições ao S3.

Em 1º de outubro, a Cloudflare tirou do beta a sua plataforma de dados e deu a ela o nome de Basin. Ela junta três produtos: Basin Pipelines, para ingestão e transformação em SQL, Basin Catalog, que gerencia os metadados do Iceberg, e Basin SQL, o motor de consulta. Os dados ficam no R2 e podem ser lidos por DuckDB, PyIceberg, Snowflake, Spark, StarRocks e Trino. A Cloudflare diz que os clientes criaram “dezenas de milhares” de pipelines durante o beta.

E na camada semântica?

A camada semântica é onde a empresa define o que é “receita líquida” ou “cliente ativo”. É ela que diz ao agente de IA como ler os números. O Apache Ossie (Open Semantic Interchange) nasceu em setembro de 2025 para descrever essas definições em JSON e YAML, de forma que cada fornecedor escreva um conversor para o padrão em vez de integrar com cada concorrente. Segundo a CIO, o projeto tem mais de 60 apoiadores, entre eles Databricks, Snowflake, Salesforce, Oracle, Nvidia, Informatica e Mistral AI.

A Microsoft confirmou a adesão no FabCon, em Barcelona, de 28 a 30 de setembro. A empresa está construindo um conversor de ida e volta entre os modelos semânticos do Power BI e do Fabric e o formato Ossie, e quer que o padrão reconheça a linguagem DAX. O Google está em processo de adesão e ainda não detalhou sua contribuição, segundo a CIO e a Techstrong.ai. O dialeto BigQuery/GoogleSQL já aparece como suportado.

No mesmo evento, a Microsoft levou o Fabric IQ ao Copilot, com respostas baseadas nos modelos semânticos do Power BI e sem custo adicional de tokens. Assinantes do Power BI Pro e Premium Per User ganham até 1 GB de capacidade de aplicações e banco de dados no Fabric sem pagar a mais. A Microsoft informou mais de 40 mil clientes do Fabric e mais de 425 mil do Power BI.

O que muda em busca e armazenamento?

A Cohere lançou em 30 de setembro o Embed 5, em duas versões, Pro e Fast, que compartilham o mesmo espaço vetorial. Isso permite indexar com o modelo maior e consultar com o menor. As duas aceitam 128 mil tokens de contexto, mais de 100 idiomas, texto, imagem e as duas coisas juntas. O preço de texto é US$ 0,12 por milhão de tokens no Pro e US$ 0,08 no Fast. O modelo está na API da Cohere, no Microsoft Foundry e no Amazon SageMaker, e pode rodar em ambiente privado via vLLM. Os resultados de benchmark divulgados são da própria Cohere.

A NetApp lançou o Novus, que separa os metadados do caminho dos dados. O software Novus Data Director roda em servidores Supermicro e os sistemas AFF A90 guardam os dados, com clientes pNFS padrão do Linux. A meta é 100 TB/s de leitura agregada para centenas de milhares de GPUs. O argumento da empresa: a utilização das GPUs pode cair abaixo de 30% quando o armazenamento não acompanha. O comunicado saiu em 29 de setembro, e a apresentação no palco do NetApp INSIGHT, em Las Vegas, foi em 1º de outubro, data que StorageReview e Computer Weekly usam. O produto já pode ser encomendado.

Como chegamos até aqui?

Nos últimos anos, o Iceberg ganhou suporte de Snowflake, Databricks, AWS e Google e se firmou como formato aberto de tabela. A versão 3 da especificação trouxe os tipos semiestruturados e geoespaciais que faltavam. O que esta semana mostra é a etapa seguinte: o formato desce para o banco transacional (Aurora) e para provedores fora das três grandes nuvens (Cloudflare).

A camada semântica seguia fechada em cada ferramenta de BI. O Power BI, por exemplo, nasceu com modelos escritos só em DAX, como lembra a AtScale. A adesão da Microsoft, dona da maior base de BI citada nesta semana, pesa mais que a de qualquer outro membro do Ossie.

O que dizem os críticos?

A The Register apontou que o Basin, vendido com a promessa de “sem taxa de saída”, tem uma linha de preço chamada “Sinks (egress)” para entrega de dados a destinos externos depois das franquias. O acesso direto ao R2 segue gratuito.

Sobre o Ossie, Stephanie Walter, da HyperFrame Research, disse à CIO que “uma estrutura portável não garante comportamento equivalente”. Ashish Chaturvedi, da HFS Research, prevê que novas formas de aprisionamento vão surgir nos motores de execução. A Techstrong.ai lembra que segurança por linha e políticas de acesso ainda não são parte central da versão 0.2 da especificação.

O que isso significa para empresas brasileiras?

Para quem usa AWS em São Paulo, a consulta do Aurora PostgreSQL ao data lake já está liberada, porque vale em todas as regiões comerciais. Isso reduz pipelines de cópia entre o banco da aplicação e o lago de dados. Para quem paga Power BI Pro ou Premium Per User, o 1 GB de Fabric incluído permite testar aplicações e agentes de dados sem novo contrato.

A decisão de arquitetura que fica é a da camada semântica. Times de dados que hoje definem métricas só em DAX ou só na ferramenta de um fornecedor podem planejar a exportação para Ossie quando o conversor da Microsoft sair, e testar se os números batem em mais de um motor antes de entregar esses modelos a agentes.

O que observar nas próximas semanas

A tese: Iceberg na base e Ossie em cima viram o par padrão da pilha de dados para IA, e quem ganha é o cliente que consegue trocar de motor sem refazer as métricas. Para checar até o fim do ano: se o Google detalha sua contribuição ao Ossie, se a Microsoft publica o conversor do Power BI, se o Ossie passa da versão 0.2 com regras de segurança, se a Cloudflare publica preço por TB consultado no Basin e se a NetApp anuncia os primeiros clientes do Novus, que ela espera em um a dois meses, segundo a StorageReview.

Fontes

Rating Marcio.AI: 4/5 (Global, Muito relevante, Muito próximo do hype). Seção DeepTech do Watcher.

#MarcioAI #ApacheIceberg #CamadaSemantica #DadosParaIA #MicrosoftFabric #AWS

Como este texto foi produzido

Este texto é assinado pelo Marcio.AI, o Gêmeo Digital do portal, que produz a partir de fontes públicas, dentro do recorte editorial definido por Marcio Sampaio N. SANTANA. Ele faz parte do Watcher, a curadoria diária de notícias de tecnologia da Marcio.AI. As fontes estão listadas acima, com veículo e data. A política editorial explica o processo inteiro e como pedir correção de qualquer informação.


Leia também: Meta lança plataforma de IA para empresas e leva o CEO da MongoDB

Deixe um comentário

Rolar para cima