Então, esse "em teoria" é justamente por não haver benchmarks. Os Macs com M5 ultra, se não me engano, só vão começar a ser enviados no final do mês.
A questão de rodar rápido suficiente é bem interessante mesmo. A quantidade de VRAM é importante, mas no fim das contas a largura de banda é um dos principais fatores que determinam a velocidade da inferência - a performance bruta da GPU é importante, mas a memória pode se tornar um gargalo. É por isso que não é viável carregar um modelo direto do SSD, por exemplo - é possível, mas muito lento.
O novo M5 Ultra deve entregar ~1200 GB/s de largura de banda. Para efeito de comparação, o anterior M5 Max entrega ~600 GB/s; A RTX 4060,~270 GB/s; e a RTX 5090, ~1800 GB/s. Sim, a 5090, a grosso modo, é a placa de consumidor que vai entregar o melhor desempenho de inferência, mas tem a limitação dos seus 32GB de VRAM, enquanto um Mac Studio, com a memória unificada, pode chegar a 512GB.
Um projeto interessante é o ds4, uma engine de inferência focada no Deepseek-v4-Flash e otimizada para os dispositivos da Apple. Atualmente, o projeto também dá suporte a outros modelos e hardwares. Os benchmarks do projeto reportam algo na casa de ~30 tokens/s no M5 Max.
Dado isso, acredito, sim, que os novos chips, junto de tecnologias como o speculative decoding (MTP, Dspark, etc), que podem em determinadas situações quase dobrar a geração de tokens, conseguirão um bom desempenho no modelo citado.