Apple mengungkap bahwa memori yang lebih cepat serta dua unit Neural Engine pada perangkat terbarunya secara signifikan meningkatkan kemampuan menjalankan model AI berukuran besar secara lokal, tanpa bergantung pada layanan cloud.
Dalam sebuah slide presentasi bertema "Enabling a Full Range of Local AI Inference," Apple memetakan kemampuan lini produknya, mulai dari iPhone dan iPad hingga Mac Studio, berdasarkan kapasitas memori, bandwidth, dan jumlah parameter aktif model AI yang bisa dijalankan.
iPhone dan iPad dengan 16GB unified memory disebut mampu menjalankan model dengan 14 miliar parameter aktif, meski bandwidth memori yang diklaim Apple, 76GB/s, sudah dilampaui chip A20 Pro yang mencapai 115,2GB/s.

MacBook Air dan Mac mini, dengan memori hingga 64GB dan bandwidth hingga 307GB/s, sanggup menjalankan model hingga 70 miliar parameter. MacBook Pro kelas atas berbekal 128GB unified memory dapat menangani model 120 miliar parameter, setara laptop RTX Spark dengan kapasitas RAM serupa.
Puncaknya ada pada Mac Studio. Dengan bandwidth memori hingga 1,2TB/s, chip M5 Ultra mendukung hingga 512GB unified memory sehingga mampu menjalankan model hingga 480 miliar parameter. Sebuah konfigurasi cluster empat unit Mac Studio, dengan total memori 2TB, bahkan diklaim mampu menjalankan model raksasa 1,6 triliun parameter.
Namun, mendapatkan Mac Studio bukan perkara mudah saat ini. Situs resmi Apple hanya menjual varian 256GB, dengan estimasi pengiriman 15-17 minggu tergantung lokasi. Harganya pun fantastis. Satu unit M5 Ultra dengan CPU 36-core, GPU 80-core, Neural Engine 32-core, dan SSD 1TB dibanderol 10.700 dolar AS. Konfigurasi empat cluster menembus 43.196 dolar AS, namun kapasitas memorinya masih di bawah 1TB. Untuk menjalankan model 1 triliun parameter, dibutuhkan delapan cluster senilai 86.392 dolar AS.
Meski demikian, Apple belum memberikan contoh konkret model AI mana yang cocok dijalankan pada tiap perangkat, atau versi kuantisasi seperti apa yang bisa didukung, sehingga panduan bagi pengguna yang ingin mencoba inferensi AI lokal masih terasa belum lengkap.
