Use mlx-vlm para imagens, OCR e documentos; use mlx-audio para transcrição e síntese de voz — tudo local.
Documentação e exemplos do motor de visão-linguagem para Apple Silicon.
Modelos multimodais fazem o mesmo que modelos de texto, mas também "enxergam" e "ouvem". Eles transformam imagens, PDFs e áudios em texto estruturado, que depois alimenta o modelo de texto ou vai direto para a nuvem. O mlx-vlm cuida de imagens; o mlx-audio cuida de som.
Pense em um tradutor universal: ele não traduz só palavras, mas também fotos, diagramas e gravações. A saída sempre é texto, então o resto do pipeline entende.
mlx-vlm suporta Qwen2.5-VL, Qwen3-VL, InternVL3, MiniCPM-V, GLM-OCR, DeepSeek-OCR, Granite Vision e Gemma 4. mlx-audio suporta Whisper, Qwen3-ASR, Voxtral, Kokoro, Qwen3-TTS, OmniVoice, Moshi e modelos de VAD/diarização.
Para OCR e documentos, os especialistas GLM-OCR (94.62 no OmniDocBench) e DeepSeek-OCR-2 (92.56) superam VLMs genéricos e ocupam menos de 7 GB. Para descrição geral e diagramas, Qwen2.5-VL-32B é o melhor equilíbrio. Para multimodal unificado com áudio, Gemma-4-12B cobre 140+ idiomas.
Recomendação do research_mlx_vlm_m5max.md: manter GLM-OCR-bf16 (~2.2 GB) sempre carregado; usar Qwen2.5-VL-32B-Instruct-4bit (~19.8 GB) como VLM geral; Qwen3-VL-30B-A3B-4bit (~18.3 GB) para agentes/vídeo longo; Gemma-4-12B-4bit (~6.8 GB) para texto+imagem+áudio.
# OCR com GLM-OCR mlx_vlm.generate --model mlx-community/GLM-OCR-bf16 --image documento.pdf --prompt "Text Recognition:" --max-tokens 2048 --temperature 0.0 # Descrição de diagrama mlx_vlm.generate --model mlx-community/Qwen2.5-VL-32B-Instruct-4bit --image diagrama.png --prompt "Descreva este diagrama em português." --max-tokens 1024 --temperature 0.2 # Servidor multimodal mlx_vlm.server --model mlx-community/Qwen2.5-VL-32B-Instruct-4bit --port 8080 --kv-bits 8
Para fala→texto (STT), o Whisper é o padrão robusto; o Qwen3-ASR 1.7B é melhor para português e suporta streaming. Para texto→fala (TTS), Kokoro é rápido e leve; Qwen3-TTS oferece qualidade, clonagem e controle de emoção.
mlx-audio expõe endpoints OpenAI /v1/audio/speech e /v1/audio/transcriptions. Recomendação: Qwen3-ASR-1.7B-8bit para STT PT, Whisper-large-v3-turbo como fallback, Kokoro-82M-bf16 para TTS rápido e Qwen3-TTS-1.7B para qualidade/clonagem.
# STT em português python -m mlx_audio.stt.generate --model mlx-community/Qwen3-ASR-1.7B-8bit --audio entrada.wav --language Portuguese --output-path output --format json # TTS rápido com Kokoro mlx_audio.tts.generate --model mlx-community/Kokoro-82M-bf16 --text "Olá, o processamento local está pronto." --voice af_heart --lang_code a --output_path ./audio # Servidor de áudio mlx_audio.server --host 127.0.0.1 --port 8000
Teste o que aprendeu com exercícios rápidos.
Cenário: você recebe um PDF escaneado. Qual modelo escolher?
Para descrição geral de imagens e diagramas, Qwen2.5-VL-32B oferece o melhor equilíbrio entre qualidade e tamanho no M5 Max.
Para STT em português, Qwen3-ASR-1.7B-8bit é superior ao Whisper em benchmarks multilíngues; Kokoro é ideal para TTS rápido.