Que tamanho tem esse ficheiro de áudio?
Publicado a 22/08/2025 · 17 min de leitura · Ferramentas para programadores
Daniel Okonkwo — Programador front-end e redator de Tecnologia na Allin
Desempenho web · Formatos de ficheiro
Verificado a partir de 6 fontes
Para PCM não comprimido o tamanho é exato e não há nada a estimar: bytes = frequência de amostragem × profundidade de bits × canais × segundos ÷ 8. O áudio de CD é 44 100 × 16 × 2 ÷ 8 = 176 400 bytes por segundo, portanto um minuto são 10 584 000 bytes — 10,58 MB, ou 10,09 MiB se o seu gestor de ficheiros contar em unidades binárias. Um master de 48 kHz, 24 bits e estéreo são 288 000 bytes por segundo; uma sessão de 96 kHz, 24 bits e oito pistas são 2 304 000 bytes por segundo, ou seja 138,24 MB por minuto e 8,29 GB por hora. Os formatos com perdas funcionam de forma completamente diferente. Um MP3 a 320 kbps é definido pelo seu débito, pelo que o seu tamanho é débito × duração: 40 000 bytes por segundo, 2,4 MB por minuto, independentemente de a fonte ser de 44,1 ou 48 kHz. A frequência de amostragem simplesmente não entra no cálculo. O débito variável torna até isso aproximado, porque o codificador gasta bits onde a música os pede e o número citado é apenas uma média. Os dois modelos cruzam-se no débito da fonte: o áudio de CD são 1411,2 kbps, por isso qualquer ficheiro com perdas codificado acima disso é maior do que o original sem perdas de onde veio.
O tamanho do áudio não comprimido é aritmética exata: frequência de amostragem × profundidade de bits × canais × segundos ÷ 8. O áudio de CD são 176 400 bytes por segundo. Um MP3 a 320 kbps, pelo contrário, é débito × duração e não depende de todo da frequência de amostragem — 2 400 000 bytes por minuto venha de 44,1 ou de 48 kHz.
A fórmula, e porque é exata
O áudio não comprimido é uma lista de números, e o tamanho de uma lista de números não se estima. O gravador colhe uma amostra da forma de onda a intervalos fixos; cada amostra é guardada num número fixo de bits; cada canal tem o seu próprio fluxo. Multiplique e divida por oito para chegar a bytes: tamanho = frequência de amostragem × profundidade de bits × canais × segundos ÷ 8. Não há compressão, nem cabeçalho digno de contagem, nem dependência do conteúdo. O silêncio e uma orquestra inteira ocupam exatamente o mesmo espaço.
Trabalhemos o caso canónico. O áudio de CD são 44 100 amostras por segundo, 16 bits por amostra, dois canais. Isso é 44 100 × 16 × 2 = 1 411 200 bits por segundo, que a dividir por 8 dá 176 400 bytes por segundo. Um minuto são 176 400 × 60 = 10 584 000 bytes. Uma hora, 635 milhões de bytes. Um disco completo de 74 minutos, a capacidade original do Red Book, contém 783 216 000 bytes de áudio; um de 80 minutos contém 846 720 000.
Uma coisa faz tropeçar toda a gente aqui, e nada tem a ver com áudio: a diferença entre MB e MiB. Um minuto de áudio de CD são 10 584 000 bytes, ou seja 10,58 megabytes se um megabyte for um milhão de bytes, e 10,09 mebibytes se for 1 048 576. Os fabricantes de armazenamento e a maioria das calculadoras usam o sentido decimal; vários gestores de ficheiros mostram o binário sob a etiqueta MB. Quando uma calculadora e uma listagem de ficheiros divergem cerca de cinco por cento, é quase sempre isso, e nenhum dos dois está errado.
Porque existe 44,1 kHz
A frequência parece arbitrária e não é. Produziram-na duas restrições distintas. A primeira é de teoria da amostragem: para reconstruir um sinal é preciso amostrar acima do dobro da sua frequência mais alta, pelo que captar a audição até 20 kHz exige mais de 40 000 amostras por segundo. Qualquer valor acima de 40 kHz satisfaz o teorema, e a margem importa porque um filtro anti-aliasing real não corta instantaneamente. A 44 100 o filtro dispõe de 44 100 ÷ 2 − 20 000 = 2 050 Hz de banda de transição para descer, algo exigente mas construível com os filtros analógicos do final dos anos 1970.
A segunda restrição fixou o número exato, e veio do vídeo. Antes de existirem gravadores digitais dedicados, a forma mais barata de guardar e expedir um master digital era codificar as amostras como um pseudo-sinal de vídeo e gravá-las num videogravador, através de um aparelho chamado adaptador PCM. O adaptador metia três amostras por canal em cada linha horizontal da imagem. A partir daí a aritmética fica forçada: em geometria de 525 linhas e 60 campos com 245 linhas úteis por campo, 3 × 245 × 60 = 44 100 exatamente. Em geometria de 625 linhas e 50 campos com 294 linhas úteis, 3 × 294 × 50 = 44 100 exatamente também.
Essa coincidência é toda a resposta. 44 100 é o único valor acima do piso de Nyquist que sai limpo em ambos os sistemas de televisão, por isso um master cortado em qualquer das máquinas levava a mesma frequência. A versão a cores do sistema de 525 linhas complica-o de um modo que vale a pena conhecer: a sua frequência de campo não é 60 mas 60 000 ÷ 1 001, e 3 × 245 × esse valor dá 44 055,944 Hz. Os primeiros adaptadores PCM da Sony funcionavam mesmo a essa frequência, geralmente citada como 44 056 Hz, e existem fitas de ambos os tipos. Quando a especificação do Compact Disc foi escrita, ganhou o número redondo, e 44 100 sobreviveu décadas aos videogravadores que o produziram.
48 kHz existe por outra razão: é uma frequência profissional escolhida para se dividir de forma limpa face às cadências de cinema e vídeo, e é por isso que toda a câmara, toda a linha de montagem e toda a cadeia de emissão funcionam a 48 kHz enquanto a distribuição musical continua a 44,1. Nenhuma é melhor; são respostas a problemas de sincronização diferentes.
O que dá a profundidade de bits, demonstrado
A profundidade de bits não afeta de todo a resposta em frequência; fixa o piso de ruído. Cada amostra é arredondada ao nível representável mais próximo, e o erro de arredondamento comporta-se como ruído acrescentado. Se o passo entre níveis for D, esse erro reparte-se de forma aproximadamente uniforme no intervalo de −D/2 a +D/2, e o quadrado médio de uma distribuição uniforme nesse intervalo é D² ÷ 12. Essa é a potência do ruído, e depende apenas do tamanho do passo.
Agora o sinal. Com n bits há 2 elevado a n níveis, pelo que uma sinusoide que use toda a escala tem uma amplitude de pico de 2 elevado a n vezes D, dividido por 2. A potência média de uma sinusoide é metade do quadrado do seu pico, o que dá (2 elevado a n × D)² ÷ 8. Divida a potência do sinal pela do ruído e o passo cancela-se: [(2 elevado a n × D)² ÷ 8] ÷ [D² ÷ 12] = 12 × 2 elevado a 2n, sobre 8, ou seja 1,5 × 2 elevado a 2n.
Passe a decibéis e aparecem as constantes famosas. Dez vezes o logaritmo decimal de 1,5 × 2 elevado a 2n é 10 log 1,5 mais 2n × 10 log 2, e 10 log 1,5 = 1,7609 enquanto 20 log 2 = 6,0206. Portanto a gama dinâmica é 6,0206 n + 1,7609 dB — a identidade citada normalmente como 6,02 × bits + 1,76. Ao avaliá-la: 8 bits dão 49,93 dB, 16 bits 98,09 dB, 20 bits 122,17 dB, 24 bits 146,26 dB e 32 bits 194,42 dB. Calcular o rácio diretamente em cada profundidade devolve os mesmos números até duas casas decimais, que é a verificação de que a dedução está certa e não apenas lembrada.
Uma ressalva honesta: os conversores de 24 bits não entregam 146 dB. O ruído térmico do andar analógico de entrada impõe um piso à volta de 120 a 125 dB nos melhores, pelo que os bits extra compram margem durante a gravação — poder ajustar níveis com prudência e normalizar depois — e não resolução audível. É um benefício real na captação e largamente teórico na entrega, e é por isso que os masters são cortados a 24 bits e publicados a 16.
Um MP3 a 320 kbps não quer saber da sua frequência de amostragem
É aqui que a intuição construída sobre PCM deixa de funcionar. Um ficheiro com perdas não é uma lista de amostras; é um fluxo de tramas codificadas, e ao codificador diz-se quantos bits por segundo pode gastar. O tamanho decorre diretamente dessa instrução: bytes = débito × segundos ÷ 8. A 320 kbps são 40 000 bytes por segundo, portanto um minuto são 2 400 000 bytes e uma faixa de três minutos e meio são 8,40 MB. A 128 kbps um minuto são 960 000 bytes e a mesma faixa são 3,36 MB.
Repare no que falta nessa fórmula: a frequência de amostragem, a profundidade de bits e o número de canais. Codifique a mesma peça de três minutos a partir de uma fonte de 44,1 kHz e de outra de 48 kHz, ambas a 320 kbps, e os dois ficheiros saem do mesmo tamanho — 2 400 000 bytes por minuto em ambos os casos. A frequência de amostragem continua a determinar o que o codificador pode representar, logo afeta a qualidade, mas não tem qualquer influência no espaço que o resultado ocupa. O mesmo vale para estéreo contra mono: a débito fixo, o mono não reduz o ficheiro a metade, apenas dá ao codificador o dobro dos bits para gastar num só canal.
O débito variável afrouxa até isso. Em VBR o codificador visa um nível de qualidade em vez de um débito, gastando mais bits nas passagens densas e menos nas escassas, e o número reportado depois é a média sobre todo o ficheiro. Uma faixa citada a 245 kbps VBR pode ter corrido a 320 nos refrões e a 160 numa introdução de piano só. Multiplicar essa média pela duração dá uma boa estimativa e não um tamanho exato, que é a diferença prática entre VBR e CBR do ponto de vista do planeamento de armazenamento.
Onde o formato com perdas deixa de poupar seja o que for
Como os dois modelos de tamanho são funções diferentes, cruzam-se. O ponto de cruzamento é o débito da fonte, e calcula-se facilmente: multiplique a frequência de amostragem pela profundidade de bits pelos canais. O áudio de CD é 44 100 × 16 × 2 = 1 411 200 bits por segundo, ou 1411,2 kbps. Um ficheiro de 48 kHz, 24 bits e estéreo é 2304 kbps. Um de 96 kHz, 24 bits e estéreo é 4608 kbps, e oito pistas do mesmo são 18 432 kbps.
Codifique acima desse número e o ficheiro com perdas é maior do que o original sem perdas de onde veio — coisa perfeitamente possível e completamente absurda, já que pagou armazenamento extra em troca de informação que foi deitada fora. Ninguém o faz de propósito, mas acontece por acidente em cadeias de transcodificação que aplicam um débito alto fixo a fontes de profundidades diferentes, e acontece com frequência quando alguém recodifica fala gravada a 8 kHz mono, cujo débito sem perdas é de apenas 64 kbps.
Entre os dois situa-se a compressão sem perdas. FLAC, ALAC e afins reconstroem as amostras originais bit a bit, pelo que a questão da qualidade não se põe, e costumam ficar à volta de 55 a 70 por cento do tamanho PCM em música corrente — grosso modo 780 a 990 kbps a partir de uma fonte de CD, embora material calmo ou escasso se comprima muito mais e material forte e denso quase nada. Ao contrário do PCM, o tamanho depende do conteúdo e não pode ser calculado de antemão; ao contrário do formato com perdas, não pode ser escolhido. Eis a taxonomia prática: o tamanho PCM é aritmética exata, o tamanho com perdas é uma decisão, o tamanho sem perdas é uma medição.
| Formato | Débito | Bytes por segundo | Um minuto | Uma hora |
|---|---|---|---|---|
| 44,1 kHz / 16 bits / estéreo (CD) | 1411,2 kbps | 176 400 | 10,58 MB | 0,635 GB |
| 48 kHz / 24 bits / estéreo | 2304 kbps | 288 000 | 17,28 MB | 1,037 GB |
| 96 kHz / 24 bits / estéreo | 4608 kbps | 576 000 | 34,56 MB | 2,074 GB |
| 96 kHz / 24 bits / 8 pistas | 18 432 kbps | 2 304 000 | 138,24 MB | 8,294 GB |
| MP3 / AAC a 320 kbps | 320 kbps | 40 000 | 2,40 MB | 144,0 MB |
| MP3 / AAC a 128 kbps | 128 kbps | 16 000 | 0,96 MB | 57,6 MB |
Exemplo calculado com a nossa ferramenta
Calculadora de tamanho de ficheiro de áudio
Dados
- Duração (minutos)
- 6
- Taxa de amostragem (kHz)
- 48,5
- Profundidade (bits)
- 32
- Canais
- 4
Resultado
- Tamanho (MB)
- 279,36
Estes números são produzidos pela calculadora abaixo, não escritos à mão — são recalculados sempre que a ferramenta muda.
Refazer com os teus números →Perguntas frequentes
- Gravar a 48 kHz em vez de 44,1 torna o meu MP3 maior?
- Não. Nem um único byte. O tamanho de um ficheiro com perdas é débito × duração ÷ 8, e a frequência de amostragem não aparece nessa expressão. Codifique a mesma peça de um minuto a 320 kbps a partir de uma fonte de 44,1 kHz e de uma de 48 kHz e ambas saem a 2 400 000 bytes. O que a frequência de amostragem muda é o material de que o codificador dispõe: 48 kHz pode representar frequências até 24 kHz onde 44,1 pára em 22,05, logo a débito fixo o codificador tem um pouco mais de espetro para descrever com o mesmo orçamento. Na prática é inaudível a 320 kbps e marginal a 128. A confusão vem do PCM, onde a frequência determina mesmo o tamanho diretamente — 48 kHz, 16 bits e estéreo são 192 000 bytes por segundo contra 176 400 do CD, cerca de nove por cento mais. Se exporta WAV, a frequência conta para o seu disco. Se exporta MP3, AAC ou Opus a débito fixo, só contam a duração e o débito.
- Porque é que o meu WAV é tanto maior do que o MP3 que fiz a partir dele?
- Porque o WAV guarda cada amostra e o MP3 guarda uma descrição. Ponhamos números: um WAV no padrão de CD corre a 1411,2 kbps, e um MP3 de 320 kbps é por definição 320 kbps, logo o rácio é 1411,2 ÷ 320 = 4,41 para um. A 128 kbps o rácio é 11,0 para um. Um minuto são 10 584 000 bytes em WAV, 2 400 000 em MP3 de 320 kbps e 960 000 a 128. A poupança não é compressão no sentido em que um ZIP comprime; é descarte. Um modelo psicoacústico decide que partes do sinal ficarão mascaradas por partes mais fortes próximas em frequência ou no tempo, e essas partes não são guardadas de todo. É por isso que o processo é irreversível e por isso recodificar um MP3 para um débito maior não recupera nada. Se quer o ficheiro mais pequeno sem descartar, use FLAC ou ALAC: reconstroem o original bit a bit e costumam ficar à volta de 55 a 70 por cento do WAV, ou seja cerca de 780 a 990 kbps a partir de material de CD.
- Os 24 bits valem mesmo o espaço extra?
- Enquanto grava, sim; para entrega, quase nunca. A aritmética diz que 16 bits dão uma gama dinâmica de 6,0206 × 16 + 1,7609 = 98,09 dB e 24 bits dão 146,26 dB, um ganho aparente de 48 dB por cinquenta por cento mais de tamanho. Mas nenhum conversor entrega 146 dB: o ruído térmico do andar analógico de entrada impõe um piso prático à volta de 120 a 125 dB no melhor hardware disponível, pelo que a maior parte dessa gama teórica é inalcançável. O que os bits extra compram mesmo é margem durante a captação. Pode acertar níveis 20 dB abaixo da escala plena para estar a salvo de picos imprevistos e ainda ter mais gama útil do que 16 bits dariam a níveis ótimos, e normalizar depois sem expor o ruído de quantização. É uma vantagem de trabalho real, e é por isso que as sessões são gravadas e misturadas a 24 bits. Na entrega, o ambiente de escuta fixa o piso — uma sala calma está à volta de 30 dB SPL e ninguém ouve música a 128 dB — logo 16 bits com dither adequado é transparente e o ficheiro é um terço mais pequeno. Grave a 24, entregue a 16.
- Porque é que o meu gestor de ficheiros indica um tamanho diferente do da calculadora?
- Quase sempre o megabyte, não o áudio. Um minuto de áudio no padrão de CD são 10 584 000 bytes. Chame megabyte a um milhão de bytes e isso lê-se como 10,58 MB; chame-lhe 1 048 576 bytes e o mesmo ficheiro lê-se como 10,09 MiB, uma diferença de cerca de 4,9 por cento. Fabricantes de armazenamento, engenheiros de rede e a maioria das calculadoras em linha usam o sentido decimal; vários sistemas operativos mostraram historicamente a quantidade binária sob a etiqueta decimal MB, e daí vem a discussão. A diferença alarga-se à medida que as unidades crescem: é de 2,4 por cento no kilobyte, 4,9 no megabyte e 7,4 no gigabyte. Podem surgir outros dois efeitos pequenos. Os ficheiros WAV levam um cabeçalho de algumas dezenas de bytes, invisível a estas escalas mas não nulo. E o tamanho em disco é arredondado por excesso a um número inteiro de blocos de alocação, pelo que um clipe curto pode ocupar bastante mais espaço do que contém. Se uma calculadora e uma listagem diferem cerca de cinco por cento por degrau de unidade, é o megabyte; se diferem umas centenas de bytes, é o cabeçalho; se um ficheiro minúsculo aparece como 4 KB, é o tamanho do bloco.
- Quanto espaço precisa uma sessão multipista?
- Multiplique o débito por canal pelo número de canais e pela duração real da sessão, não pela do tema acabado. Uma sessão de 96 kHz, 24 bits e oito pistas corre a 96 000 × 24 × 8 ÷ 8 = 2 304 000 bytes por segundo, ou seja 138,24 MB por minuto e 8,29 GB por hora de gravação. Aos mais comuns 48 kHz e 24 bits, oito pistas são 1 152 000 bytes por segundo, ou 69,12 MB por minuto. O fator que se subestima é a duração real: uma sessão que rende quatro minutos de take aproveitável pode ter tido o transporte a rodar duas horas em todos os canais, e cada uma dessas horas é guardada por inteiro, porque ao PCM tanto faz se alguém estava a tocar. Acrescente cerca de trinta a cinquenta por cento por cima para o histórico de edição, os ficheiros de congelamento e bounce e o estado de anular, consoante a estação de trabalho. Dois hábitos de trabalho controlam o total melhor do que qualquer escolha de formato: parar o transporte entre takes e gravar apenas os canais com fonte ligada em vez de armar toda a mesa.
Artigos que podem interessar-lhe
Todos os guias →Ferramentas relacionadas
Fontes
- Audio Engineering Society — AES5-2018: AES recommended practice for professional digital audio — preferred sampling frequencies
- Audio Engineering Society — AES3: Serial transmission format for two-channel linearly represented digital audio data
- IEC — IEC 60908 — Audio recording: Compact disc digital audio system (the Red Book parameters)
- ITU-R — Recommendation BS.646 — Source encoding parameters for digital sound signals in broadcasting
- ISO/IEC — ISO/IEC 11172-3 — MPEG-1 Audio (Layer III, the MP3 bitstream and its bitrate model)
- IETF — RFC 6716 — Definition of the Opus Audio Codec, including constant and variable bitrate operation
Detetaste um erro neste artigo?