OceanPact
Web Summit Rio 2026 · Disseminação de Conhecimento

O último quilômetro da inteligência

A computação está migrando da nuvem centralizada para a borda — onde os usuários realmente estão, onde a latência se manifesta e onde ocorrerão os próximos bilhões de interações de IA.

Palestrante: Kevin Gongmei Xu
Evento: Web Summit Rio 2026
Tema: IA, Inferência & Edge Computing
Sobre a apresentação

Do treinamento à inferência: a nuvem de borda para a próxima era da IA

O data center construiu a era da IA. A computação de borda a definirá. À medida que a demanda por inferência aumenta e a IA em tempo real deixa de ser uma ambição para se tornar uma expectativa, a computação está migrando da nuvem centralizada para onde os usuários realmente estão.

A CloudSky construiu todo o seu negócio em torno dessa fronteira — a última milha, onde a latência se manifesta e onde ocorrerão os próximos bilhões de interações de IA. A palestra destacou a transição acelerada da IA do foco em treinamento para a inferência em tempo real, enfatizando que o gargalo competitivo migra da criação da inteligência (em grandes data centers) para a entrega da inteligência (na borda).

Palestrante

Quem apresentou

KX

Kevin Gongmei Xu

Co-founder da CloudSky — nuvem de borda nativa em GPU, que opera uma rede distribuída de baixa latência em centenas de cidades para atender aplicações sensíveis à latência e experiências interativas de IA em tempo real.

Resumo executivo

A virada do treinamento para a inferência em tempo real

CloudSky posiciona-se como uma “nuvem de borda nativa em GPU”, levando a capacidade de inferência ao último quilômetro. O Brasil foi apresentado como um ecossistema emergente e promissor para a expansão da infraestrutura de inferência, com paralelos ao dinamismo tecnológico observado na China.

1400x Crescimento do consumo diário de tokens de IA na China em 2 anos (de ~100 bi para 140 tri)
300+ Cidades cobertas pela rede de borda nativa em GPU da CloudSky
600 mi Usuários atendidos pela infraestrutura distribuída
Pontos-chave

O que foi apresentado

  • Surto de demanda por inferência: em dois anos, o consumo diário de tokens de IA na China teria saltado de ~100 bilhões para 140 trilhões — um aumento de 1400x, ilustrando a explosão de uso em tempo real.
  • Da centralização à borda: no paradigma de treinamento, o foco era construir data centers maiores e adicionar GPUs; no paradigma de inferência, o desafio é a proximidade ao usuário para reduzir latência.
  • Entregar é tão crítico quanto treinar: “entregar” a inteligência torna-se tão decisivo quanto “treiná-la”, com GPUs distribuídas onde pessoas e máquinas realmente estão.
  • Proposta da CloudSky: GPU-native edge AI cloud, com infraestrutura distribuída de GPU e computação em tempo real para streaming, aplicações interativas, operadoras móveis e internet.
  • Último quilômetro: estratégia de levar inferência para a última milha, onde a latência se manifesta e onde ocorrerão os próximos bilhões de interações de IA.
  • Brasil como fronteira: população jovem, mentalidade aberta e alta receptividade tecnológica — com ecossistema de aplicações em crescimento (T-Top, Ananovo, operadoras móveis e streaming).
Citações importantes

Nas palavras do palestrante

“O data center construiu a era da IA. A borda vai defini-la conforme a inferência, a demanda e o tempo real disparam.”
“A IA vai da ambição à expectativa.”
“O gargalo não é mais criar a inteligência, é entregá-la.”
“Somos uma nuvem de borda nativa em GPU… nossa rede cobre mais de trezentas cidades e atende 600 milhões de usuários.”
“A entrega será tão importante quanto o treinamento.”
“Acreditamos que o Brasil tem muitas oportunidades de ser a próxima China.”
“Tornar a computação uma utilidade para todos — na América Latina, no Brasil.”
Pontos de ação

O que levar para a prática

  • Mapear latência crítica: identifique onde a experiência do usuário sofre por latência e priorize mover a inferência para a borda nessas rotas.
  • Avaliar arquitetura multi-região/edge: desenhe a pilha para executar modelos próximos ao usuário (PoPs locais, GPUs distribuídas, roteamento inteligente).
  • Rebalancear investimento: reoriente parte do CAPEX/OPEX do treinamento centralizado para a entrega de inferência (caching de modelos, autoscaling na borda, observabilidade de SLOs).
  • Pilotar casos de tempo real: selecione workloads que dependem de resposta imediata (assistentes, recomendação, streaming interativo).
  • Parcerias com provedores de edge: explore integração com nuvens de borda para cobertura urbana e redução de latência no último quilômetro.
  • Localização no Brasil: alinhe-se ao ecossistema local (operadoras, plataformas de streaming, integradores) para acelerar distribuição e adoção.
  • Medir impacto: estabeleça métricas técnicas e de negócio (p95/p99 de latência, conversão, retenção, custo por chamada de inferência) para validar ganhos da migração à borda.
Registros da palestra

Galeria

O último quilômetro da inteligência — registro 01
O último quilômetro da inteligência — registro 01
O último quilômetro da inteligência — registro 02
O último quilômetro da inteligência — registro 02
O último quilômetro da inteligência — registro 03
O último quilômetro da inteligência — registro 03

Dica: clique em qualquer slide para visualizá-lo em tamanho real. Pressione ESC ou clique fora da imagem para fechar.