トレンド一覧

Appleシリコン上で動作する大規模モデルInkling-Smallの推論パフォーマンス

r/LocalLLaMA ・ 2026-08-05

原題: Inkling-Small 276B-A12B at ~2.9 tok/s on <10gb memory

AI による要約

AppleのMシリーズチップ上で、大規モデル「Inkling-Small」が限られたメモリ容量でも効率的に動作することが検証されました。ローカル環境での大規模モデル実行の可能性と最適化の進展を示しています。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル

この話題のこれまで

2026年7月下旬から8月上旬にかけ、Apple Silicon上で大規模モデルを動作させる技術が複数公開された。まず7月25日にGemma 4 12BモデルのCore ML化により、Apple Silicon Mac上で128Kコンテキストの長文処理が可能な実装が示され、7月29日にはCUDAの最適化ノウハウをMLX向けに移植する手法が紹介された。8月3日にはAppleとOpenAIの法的対立が表面化し、8月4日にはHy3 T512のM3 Ultra実測でメモリ使用量の課題が明らかになり、同日にAppleの元従業員による機密データ流出疑惑の調査拡大が報じられた。8月5日にはM2 Ultraを用いた4モデルの実測比較が行われ、クローズド環境向けローカルLLMの選定に関するデータが提供された。8月5日にはApple Silicon上で大規模モデルInkling-Smallが限られたメモリ容量でも効率的に動作することが検証され、ローカル環境での実行可能性がさらに示された。

  1. Gemma 4 12B を Core ML で 128K コンテキストで動かす 2026-07-25 ・ Zenn LLM
  2. CUDAの最適化ノウハウをApple SiliconのMLX向けに移植する手法 2026-07-29 ・ Berkeley AI Research
  3. OpenAIがAppleの訴訟に対し反論とメッセージを公開 2026-08-03 ・ OpenAI News
  4. Hy3 T512をM3 Ultra 512GBで実測 2026-08-04 ・ Zenn LLM
  5. Appleの元従業員による機密データ流出疑惑の調査が拡大 2026-08-04 ・ TechCrunch AI
  6. クローズド環境向けローカルLLMの選定、M2 Ultraでの4モデル実測比較 2026-08-05 ・ Zenn LLM

当サイトが集めた記事から、同じ話題のものを古い順に並べています。