Passo 4 · Modelos · Modelos · Visão, Áudio e Multimodal EN
Cluster Local de IA · Visual Course

Visão, Áudio e Multimodal

Use mlx-vlm para imagens, OCR e documentos; use mlx-audio para transcrição e síntese de voz — tudo local.

Objetivos desta lição
  • Escolher VLMs para OCR, documentos e descrição de imagens.
  • Configurar STT e TTS com mlx-audio.
  • Entender quando usar modelos especialistas vs modelos unificados.
Leia primeiro (fonte primária)
Blaizzy/mlx-vlm no GitHub

Documentação e exemplos do motor de visão-linguagem para Apple Silicon.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


Modelos multimodais fazem o mesmo que modelos de texto, mas também "enxergam" e "ouvem". Eles transformam imagens, PDFs e áudios em texto estruturado, que depois alimenta o modelo de texto ou vai direto para a nuvem. O mlx-vlm cuida de imagens; o mlx-audio cuida de som.

Pense em um tradutor universal: ele não traduz só palavras, mas também fotos, diagramas e gravações. A saída sempre é texto, então o resto do pipeline entende.

Por baixo do capô

mlx-vlm suporta Qwen2.5-VL, Qwen3-VL, InternVL3, MiniCPM-V, GLM-OCR, DeepSeek-OCR, Granite Vision e Gemma 4. mlx-audio suporta Whisper, Qwen3-ASR, Voxtral, Kokoro, Qwen3-TTS, OmniVoice, Moshi e modelos de VAD/diarização.

Imagem/PDF mlx-vlm OCR / descrição Áudio mlx-audio STT / TTS Saída comum: texto estruturado para o resto do pipeline
Duas entradas não-texto, uma saída de texto.
2

VLMs e OCR


Para OCR e documentos, os especialistas GLM-OCR (94.62 no OmniDocBench) e DeepSeek-OCR-2 (92.56) superam VLMs genéricos e ocupam menos de 7 GB. Para descrição geral e diagramas, Qwen2.5-VL-32B é o melhor equilíbrio. Para multimodal unificado com áudio, Gemma-4-12B cobre 140+ idiomas.

Por baixo do capô

Recomendação do research_mlx_vlm_m5max.md: manter GLM-OCR-bf16 (~2.2 GB) sempre carregado; usar Qwen2.5-VL-32B-Instruct-4bit (~19.8 GB) como VLM geral; Qwen3-VL-30B-A3B-4bit (~18.3 GB) para agentes/vídeo longo; Gemma-4-12B-4bit (~6.8 GB) para texto+imagem+áudio.

GLM-OCR 94.62 OmniDocBench ~2.2 GB Qwen2.5-VL-32B 87.02 OmniDocBench ~19.8 GB Gemma-4-12B texto+imagem+áudio ~6.8 GB Especialistas vencem em OCR/documentos; generalistas são mais versáteis
Escolha entre especialistas de OCR e VLMs gerais conforme a tarefa.
Terminal · mlx-vlm
# OCR com GLM-OCR
mlx_vlm.generate --model mlx-community/GLM-OCR-bf16   --image documento.pdf --prompt "Text Recognition:"   --max-tokens 2048 --temperature 0.0

# Descrição de diagrama
mlx_vlm.generate --model mlx-community/Qwen2.5-VL-32B-Instruct-4bit   --image diagrama.png --prompt "Descreva este diagrama em português."   --max-tokens 1024 --temperature 0.2

# Servidor multimodal
mlx_vlm.server --model mlx-community/Qwen2.5-VL-32B-Instruct-4bit   --port 8080 --kv-bits 8
3

Áudio: STT e TTS


Para fala→texto (STT), o Whisper é o padrão robusto; o Qwen3-ASR 1.7B é melhor para português e suporta streaming. Para texto→fala (TTS), Kokoro é rápido e leve; Qwen3-TTS oferece qualidade, clonagem e controle de emoção.

Por baixo do capô

mlx-audio expõe endpoints OpenAI /v1/audio/speech e /v1/audio/transcriptions. Recomendação: Qwen3-ASR-1.7B-8bit para STT PT, Whisper-large-v3-turbo como fallback, Kokoro-82M-bf16 para TTS rápido e Qwen3-TTS-1.7B para qualidade/clonagem.

Áudio de entrada STT Qwen3-ASR / Whisper TTS Kokoro / Qwen3-TTS
STT converte áudio em texto; TTS converte texto em áudio.
Terminal · mlx-audio
# STT em português
python -m mlx_audio.stt.generate   --model mlx-community/Qwen3-ASR-1.7B-8bit   --audio entrada.wav --language Portuguese --output-path output --format json

# TTS rápido com Kokoro
mlx_audio.tts.generate   --model mlx-community/Kokoro-82M-bf16   --text "Olá, o processamento local está pronto."   --voice af_heart --lang_code a --output_path ./audio

# Servidor de áudio
mlx_audio.server --host 127.0.0.1 --port 8000
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Cenário: você recebe um PDF escaneado. Qual modelo escolher?

Melhor escolha para extrair texto de PDFs escaneados com alta precisão:
a está correta. GLM-OCR é especialista OCR e lidera o OmniDocBench. Qwen3.6-35B-A3B é texto; Kokoro é TTS.

Para descrição geral de imagens e diagramas, Qwen2.5-VL-32B oferece o melhor equilíbrio entre qualidade e tamanho no M5 Max.

Para STT em português, Qwen3-ASR-1.7B-8bit é superior ao Whisper em benchmarks multilíngues; Kokoro é ideal para TTS rápido.

Recordar
Qual a saída comum de mlx-vlm e mlx-audio?
Clique para virar
Texto estruturado, que pode alimentar modelos de texto, RAG ou ser enviado para nuvem enxuto.
Recordar
Por que usar Qwen3-ASR em vez de Whisper para PT?
Clique para virar
Qwen3-ASR é um ASR dedicado com suporte explícito a português e geralmente supera Whisper em benchmarks multilíngues.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.