Benchmarks de hardware
Medianas da faixa comum para o Qwen3.8 Flash Next. O custo local e o retorno recalculam com suas horas, sua eletricidade e seus preços de API.
Qwen3.8 Flash Next · um fluxo · leitura e depois escrita · ModelDock benchmarks
Os preços padrão de API são US$ 0,10 por milhão de tokens de leitura e US$ 0,64 por milhão de tokens de escrita. Em 90/10 essa mistura bate a coluna de valor de API publicada. Ajuste para o que você realmente paga.
Sua carga
29 perfis de hardware · Linhas com duas GPUs precisam de espaço no gabinete, folga de energia e escalonamento multi-GPU.
| Encaixe | Evidência | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| RTX 4090 single-card node | 24 GB | 4.000 | 109,3 | Folgado | 550 W | $4.199 | 75,8 | $0,056 | $1,98 | $11,67 | 433 d | Mediana |
| RTX 5080 16GB GDDR7 · single-card node | 16 GB | 3.712,5 | 80,7 | Folgado | 510 W | $2.800 | 58,3 | $0,058 | $1,84 | $8,98 | 392 d | Mediana |
| RTX 5070 Ti 16GB · Q3 or smaller only | 16 GB | 2.498,5 | 71,1 | Folgado | 450 W | $2.380 | 48,9 | $0,060 | $1,62 | $7,53 | 403 d | Mediana |
| RTX 3090 single-card node | 24 GB | 2.094 | 86,5 | Folgado | 500 W | $2.700 | 54,5 | $0,060 | $1,80 | $8,39 | 410 d | Mediana |
| RTX 4070 Ti SUPER 16GB 16GB GDDR6X · single-card node | 16 GB | 1.700 | 72 | Folgado | 435 W | $2.140 | 45,0 | $0,061 | $1,57 | $6,94 | 398 d | Mediana |
| RTX 5090 single-card node | 32 GB | 5.803 | 168,4 | Folgado | 700 W | $8.500 | 115,4 | $0,062 | $2,52 | $17,77 | 558 d | Mediana |
| RTX 3090 Ti single-card node | 24 GB | ~2.255,1 | ~93,1 | Folgado | ~600 W | $2.774 | 58,6 | $0,063 | $2,16 | $9,03 | 404 d | Estimativa |
| AMD Radeon RX 7900 XTX 24GB GDDR6 · single-card node | 24 GB | 1.459,3 | 75,5 | Folgado | 475 W | $2.000 | 44,5 | $0,063 | $1,71 | $6,85 | 389 d | Mediana |
| AMD Radeon RX 9070 XT 16GB 16GB GDDR6 · single-card node | 16 GB | 1.652 | 53,8 | Folgado | 454 W | $2.000 | 35,9 | $0,076 | $1,63 | $5,54 | 513 d | Mediana |
| Ryzen AI Max+ 395 128 GB Radeon 8060S · 128GB unified memory | 128 GB | 1.320 | 51,4 | Folgado | 170 W | $3.500 | 32,9 | $0,077 | $0,61 | $5,06 | 786 d | Mediana |
| 2× RTX 5060 Ti 16GB each · dual-card node | 32 GB | 1.602 | 67,6 | Folgado | 480 W | $2.960 | 42,3 | $0,079 | $1,73 | $6,52 | 618 d | Mediana |
| RTX 5070 12 GB 12GB GDDR7 · single-card node | 12 GB | 1.443,2 | 48,3 | Folgado | 400 W | $2.070 | 32,1 | $0,080 | $1,44 | $4,94 | 592 d | Mediana |
| 2x RTX 3090 24 GB 24 GB each · dual-card layer split | 48 GB | 2.137,6 | 111,3 | Apertado | 850 W | $4.200 | 65,5 | $0,082 | $3,06 | $10,08 | 598 d | Mediana |
| Mac Studio M5 Ultra 96 GB 30-core CPU · 64-core GPU · 96GB unified memory | 96 GB | ~2.284,8 | ~64,8 | Folgado | ~360 W | $5.499 | 44,6 | $0,097 | $1,30 | $6,87 | 987 d | Estimativa |
| DGX Spark 128GB unified memory | 128 GB | 2.228,5 | 48,7 | Folgado | 170 W | $5.100 | 35,2 | $0,097 | $0,61 | $5,41 | 1.062 d | Mediana |
| RTX PRO 6000 Blackwell 96GB GDDR7 ECC · single-card node | 96 GB | 8.987,9 | 171,1 | Folgado | 720 W | $18.317 | 126,2 | $0,100 | $2,59 | $19,44 | 1.087 d | Mediana |
| 2x RTX 3060 12 GB 12 GB each · dual-card layer split | 24 GB | 1.239,8 | 41,3 | Folgado | 490 W | $1.814 | 27,5 | $0,100 | $1,76 | $4,23 | 736 d | Mediana |
| MacBook Pro M5 Max 128 GB 128GB unified memory | 128 GB | 1.310 | 67,3 | Folgado | 120 W | $6.699 | 39,8 | $0,103 | $0,43 | $6,12 | 1.177 d | Mediana |
| 2x TITAN RTX 24 GB 24 GB each · dual-card layer split | 48 GB | 1.698,2 | 60,6 | Folgado | 710 W | $2.881 | 39,6 | $0,104 | $2,56 | $6,10 | 812 d | Mediana |
| AMD Radeon RX 6900 XT 16GB 16GB GDDR6 · single-card node | 16 GB | 466 | 47,6 | Folgado | 450 W | $1.669 | 21,4 | $0,118 | $1,62 | $3,30 | 994 d | Mediana |
| 2x AMD Radeon RX 6900 XT 16GB 16 GB each · dual-card layer split | 32 GB | 772,3 | 63 | Folgado | 750 W | $2.138 | 31,4 | $0,123 | $2,70 | $4,83 | 1.002 d | Mediana |
| Mac Studio M5 Ultra 256 GB 36-core CPU · 80-core GPU · 256GB unified memory | 256 GB | 2.856 | 81 | Folgado | 360 W | $10.799 | 55,8 | $0,129 | $1,30 | $8,59 | 1.481 d | Mediana |
| Mac Studio M5 Max 64 GB 40-core GPU · 64GB unified memory | 64 GB | ~517,9 | ~36 | Folgado | ~180 W | $3.799 | 19,1 | $0,143 | $0,65 | $2,95 | 1.653 d | Estimativa |
| MacBook Pro M5 Max 64 GB 40-core GPU · 64GB unified memory · source chassis undisclosed | 64 GB | 517,9 | 36 | Folgado | 120 W | $5.099 | 19,1 | $0,169 | $0,43 | $2,95 | 2.028 d | Mediana |
| Mac Studio M5 Max 128 GB 40-core GPU · 128GB unified memory | 128 GB | ~517,9 | ~36 | Folgado | ~180 W | $5.399 | 19,1 | $0,188 | $0,65 | $2,95 | 2.349 d | Estimativa |
| Mac mini M5 Pro 64 GB 18-core CPU · 20-core GPU · 64GB unified memory | 64 GB | ~259 | ~18 | Folgado | ~110 W | $2.899 | 9,6 | $0,207 | $0,40 | $1,47 | 2.691 d | Estimativa |
| Mac Studio M4 Max 128 GB 128GB unified memory · source-backed oMLX profile | 128 GB | 446,8 | 32,5 | Folgado | 145 W | $6.500 | 17,0 | $0,241 | $0,52 | $2,61 | 3.108 d | Mediana |
| Mac Studio M3 Ultra 512 GB 80-core · 512GB unified memory | 512 GB | 479,6 | 18,1 | Folgado | 330 W | $9.499 | 11,7 | $0,548 | $1,19 | $1,80 | 15.580 d | Mediana |
| RTX 4070 12 GB 12GB board-dependent GDDR6/GDDR6X · single-card node | 12 GB | 1.376 | 36,9 | Folgado | 350 W | — | 25,7 | — | $1,26 | $3,96 | — | Mediana |
Hardware escolhido
RTX 4090
24 GB · single-card node
Leitura tok/s
4.000Escrita tok/s
109,3Potência
550 WM tok/dia
75,8Local $/M
$0,056Energia/dia
$1,98Valor API/dia
$11,67Retorno
433 dComo os números mudam
- A capacidade diária é horas ativas vezes a taxa mista. O tempo é sequencial: fração de leitura dividida por tok/s de leitura, mais fração de escrita dividida por tok/s de escrita.
- A energia por dia é a potência do nó inteiro vezes as horas vezes o seu preço de eletricidade.
- O custo local por milhão de tokens é energia mais hardware diluído na vida útil, dividido pela capacidade diária. Uma GPU discreta é o preço da placa mais US$ 1.200 de host.
- Os dias de retorno são o preço do conjunto dividido pelo valor de API por dia menos a energia por dia. Compara os preços de API acima; não é uma promessa de economia.