llama.cpp公式サイトが登場、ローカルコーディングエージェントとの連携も

llama.cppの公式ホームページが公開され、ローカルLLMの実行環境としての魅力を紹介。`llama serve`と`pi-llama`プラグインを使えば、Piというコーディングエージェントが自動的にローカルモデルを検出し、設定やAPIキーなしで利用可能。データはすべて手元に留まり、外部に送信されない。また、Apple SiliconからRTX 5090、CPU、Jetson、H100まで、あらゆるハードウェアで動作し、同じバイナリとモデルで最適化されたカーネルを提供する。
ファイルはあなたのマシンに留まり、リクエストが外部に出ることはありません。
HNでの議論
165- hypfer
今では古いニュースですが、llama-serverがしばらく前からマルチモデルに対応していることをご存じないかもしれません。つまり、あなた(つまり、llama.cppのコードを読んだAIエージェント)は、特定のハードウェア上の特定のモデルに最適化されたパラメータを指定したiniファイルを書くことができます。(テストによってあなたが最適化するのです。AIがやるわけではありません。)その後、任意のAPIクライアントはモデルを選択するだけで、システムが適切な処理を行います。素晴らしいソフトウェアです。ただ動くのです。
ソーシャルメディアでのカルト的なコマンドラインオプションは無視する必要があります。しかし、開発者の言うことは聞くべきです。
もうngram-mod(あるいは単にspec-default)を有効にしましたか?実質的に無料です。
- karimf
なぜ今フロントページにあるのかはわかりませんが、特別な要件がない限り、他の推論フレームワークを使うよりも、ローカルでAIモデルを実行するためにllama.cppを使うことを強くお勧めします。
ggerganovとチームは、新しいモデルや改善を迅速に実装しながらも、品質を維持するという素晴らしい仕事をしてきました。
- imrehg
llama.cppはFramework 13ラップトップでかなりうまく動作しますが、現在の「速く動かし、壊し、めったに直さない」時代(すみません、そう感じるのです)は、ここでかなり影響を与えています。
2つの例:
- https://github.com/ggml-org/llama.cpp/pull/25863 誰かの数行の変更が、Framework(および他の統合システム)内のAMD GPUのネイティブ(ROCm)サポートを壊し、ロールバックや適切な修正はほぼ1ヶ月間保留されています。幸いなことに回避策(ROCmデバイスではなくVulkanに切り替える)がありますが、バグが導入された方法も修正されない方法も、あまり信頼感を与えません。
- LM Studioは内部でllama.cppをGGUFに使用しており、クローズドソースのシステムとともに独自のビルドを「ランタイム」として出荷しています。彼らのROCmランタイムは、llama.cppバージョンがサポートしているにもかかわらず、Framework内のAMD GPUを有効にしません。そのため、彼らのランタイムはサポートされているAMD GPUがないと常に言ってきます。繰り返しますが、解決策はVulkanデバイスでGPUを使用することです。少なくとも1月から修正されていません https://github.com/lmstudio-ai/lmstudio-bug-tracker/issues/1...
全体的に、これまで見た中で最悪のランタイムだと思いますが、他のランタイムと比較して... 私はファンですが、場合によっては知識が不足していたり、修正する手段がなかったりして、それが残念に感じます...
- walrus01
curlでbashにパイプすることを提案するものは、単純にぞっとします。(編集:これが完全に合理的でないことはわかっていますが、私には奇妙に思えるだけです。私たちは多くのソフトウェアをダウンロードして信頼し、多数のパッケージリポジトリからコードを実行することを日常的に行っています...)。
llama.cppをgit cloneしてビルドしてください。難しくありません。
https://github.com/ggml-org/llama.cpp/blob/master/docs/build...
基本的な手順は文字通り数ステップです:
git clone https://github.com/ggml-org/llama.cpp
cmake -B build
cmake --build build --config Release
- tosh
URLには少し疑念がありましたが、llama.cppのGitHubにもリストされています。
- pplonski86
昨日、構築中のローカルAIデータアナリストでテストするためにllama.cppをインストールしました。他のオープンLLMプロバイダー(Ollama、Jan、vLLM、LM Studio)もテストしていました。古いNVIDIAカード(RTX 3070)を持っていましたが、llama.cppのインストールはスムーズでした。一方、vLLMはデフォルトで最新のCUDAドライバをインストールするため、CUDAドライバを再インストールする必要がありました。同じオープンLLMモデルを異なるランナーで提供した場合の速度差があるかどうか興味があります。
- halyconWays
llama.cppはAIのffmpegのようなもので、Ollamaが大嫌いな理由の一つは、後者が前者のリブランドであることを完全に隠していることです。Georgi Gerganovとチームがすべての難しい作業を行いました。Ollamaはlangchain風のVC向けの餌で、HFダウンロードラッパーに過ぎません。
- prologic
llama.cpp(そしてllama.app)は本当にOllamaよりそんなに優れているのでしょうか?私はOllamaでしか遊んだことがないので、他の人の実際の経験を聞いて純粋に興味があります。