Views
No views yet
Note: For full-duplex (real-time) inference, use the 8-bit variant instead. 4-bit quantization degrades PersonaPlex response quality significantly — INT8 is both 30% faster (112ms vs 158ms/step) and produces coherent responses where INT4 generates garbled output.
| Component | Architecture | Size |
|---|---|---|
| Temporal Transformer | 32-layer, 4096d, 32 heads (7B params) | ~3.5 GB (4-bit) |
| Depformer | 6-layer, 1024d, 16 heads, per-codebook weights | ~50 MB (fp16) |
| Mimi Codec | SEANet encoder/decoder + 8L transformer + 16 RVQ codebooks | ~370 MB (fp16) |
| Embeddings | Text + 16 audio embeddings + output heads | ~940 MB (fp16) |
| Total | ~4.9 GB |
[User Audio 24kHz] → [Mimi Encoder] → 16 codebook tokens @ 12.5Hz
↓
[Temporal Transformer: 32L, dim=4096, 7B params]
17 streams: text + 8 user audio + 8 agent audio
↓
[Depformer: 6L, dim=1024, per-codebook weights]
16 sequential steps → agent audio codebook tokens
↓
[Agent Audio 24kHz] ← [Mimi Decoder] ← codebook tokens @ 12.5Hz| Category | Voices |
|---|---|
| Natural Female | NATF0, NATF1, NATF2, NATF3 |
| Natural Male | NATM0, NATM1, NATM2, NATM3 |
| Variety Female | VARF0, VARF1, VARF2, VARF3, VARF4 |
| Variety Male | VARM0, VARM1, VARM2, VARM3, VARM4 |
temporal.safetensors — Temporal transformer (4-bit quantized, group_size=64)depformer.safetensors — Depformer layers + input projections (fp16)embeddings.safetensors — Text/audio embeddings + output heads (fp16)mimi.safetensors — Mimi neural audio codec (fp16)voices/*.safetensors — Voice preset embeddingstokenizer_spm_32k_3.model — SentencePiece tokenizerconfig.json — Model configurationin_proj): kept fp16 (packed Q+K+V format)1import PersonaPlex
2
3let model = try await PersonaPlexModel.fromPretrained()
4let response = model.respond(
5 userAudio: audioSamples, // [Float] 24kHz mono
6 voice: .NATM0,
7 maxSteps: 500
8)swift run personaplex-cli --input question.wav --output response.wav --voice NATM01@article{nguyen2025personaplex,
2 title={PersonaPlex: Enhancing Human-Centric AI Through Full-Duplex Multi-Turn Conversations With Persona-Conditioned Voice Responses},
3 author={Nguyen, Tu Anh and others},
4 journal={arXiv preprint arXiv:2504.07966},
5 year={2025}
6}