データをローカルに保ちながら、難しい仕事にはクロードを使用できるハイブリッド AI セットアップを構築しました
ローカル LLM は飛躍的に改善されました。一部のモデルは、日常の多くのタスクをクラウド モデルに置き換えるのに十分な機能さえあります。ただし、特に当面のタスクで必要な場合には、一部の領域では依然として大きなギャップが存在します。 知っている 仕事についてたくさん話したり、長時間議論したりする。
このような状況では、代わりにクラウド AI モデルを使用することが合理的です。しかし、そこが問題点です。タスクの途中で、すべてのファイルをデジタル的に取得して、次の場所に移動する必要があるのです。 違う AIって迷惑だよな。
そのため、統合されたクラウド フォールバック オプションを備えたセットアップを作成しました。
ローカルファースト、状況が困難になった場合はオプションでクラウドフォールバックを利用可能
チャットインターフェイスは 1 つですが、モデルは 2 つあります
クラウド フォールバックを使用したローカル ファースト モデルのセットアップには、3 つの異なるコンポーネントがあります。 1 つ目はローカル部分です。私の場合は、5070 Ti で実行されている Qwen 3.x または Gemma 4 モデルを搭載した Ollama です。 2 番目の部分はクロードです。これは、複雑さのため、または PC で可能なコンテキスト ウィンドウが限られているため、ローカル セットアップで問題を処理できないときはいつでも利用できます。
3 番目の層は基本的に接着剤であり、ローカル AI を使用できるようになります。 そして 必要に応じてクロードにアクセスします。
プライバシーとセキュリティ上の理由から、自動的にフォールバックするように設定していません。送信される情報を制御できるように、クラウドベースのモデルの使用を常に手動で選択したいと考えています。
処理できるものが必要な場合 自動 フォールバックとして、プロンプトの長さ、ローカル コンテキスト ウィンドウがいっぱいになったとき、またはその他の基準に基づいてジョブをクロードに渡す、ある種のルーター層を使用することもできます。
また、Jan などのアプリを介した API アクセスは、ブラウザーまたは Claude アプリ経由で Claude で使用する標準のサブスクリプションとは異なることに注意することが重要です。
ローカルでほとんどのことを処理できる
デフォルトでのプライバシー
私が行っていることのほとんどは非常に単純です。データを処理したり、仕様文書をすばやく要約したり、小さなスクリプト スニペットを生成したりしています。特に Qwen 3.8 がリリースされて以来、そのようなことはローカルで簡単に行うことができます。人々はこのモデルを「考えすぎている」と批判していますが、私の経験によると、Qwen 3.8 の考えすぎる傾向が、このような小さなモデルでこれほどの機能を備えている理由の大きな部分を占めています。
ほぼあらゆる状況で役立つスマートな機能です。
シミュレートされた医療データ、実際の税務書類、仕事データに対してテストしましたが、世界について十分な知識がない場合にのみ失敗することがわかりました。値を幻覚させたり、チャートから値を誤ってコピーしたりすることはほとんどありません。
プライバシー以外にも、いくつかの実用的な利点があります。すべてのクラウドベースのモデルには、使用量の上限、レート制限、または API コストに関する考慮事項が導入されていますが、ローカルファーストのアプローチを選択することで回避できます。 Qwen に 15 回連続してクエリを実行したときに発生する唯一のコストは電気代です。 Claude の API セットアップを使用すると、それらすべてに料金を支払うことになります。さらに、ローカル モデルは、インターネットが切断されても機能します。
より大きな頭脳が必要な場合もあります
ただし、270 億パラメータのモデルでは仕事を完了できない点があります。実際に、非常に長いコンテキスト ウィンドウ、微妙な推論 (AI が推論できる範囲で)、または大規模なリファクタリング ジョブを必要とするジョブはすべて、現時点で 5070 Ti で実行できるモデルの能力をはるかに超えていることがわかりました。ローカル モデルは、コンテキスト ウィンドウが特定のサイズを超えるとひどい幻覚を起こすか、完全にいっぱいになって停止します。
彼らはまた、何かについての知識が重要な場合にも苦労します。結局のところ、27B のパラメータを持つモデルが、いくつかのパラメータを持つモデルと同じくらい多くのことを知っているとはほとんど期待できません。 兆 パラメータ。
API アクセスは無料ではないため、クラウドに送信するものについては慎重に行う必要があります。
独自のハイブリッドアプローチを設定する
Ollama、Jan、API キー
独自のハイブリッド セットアップを実行するには、いくつかのことが必要です。
-
Ollama または Llama.cpp
-
あなたが好きな地元のモデル
-
Jan のような、ある種のインターフェイス
-
選択したクラウド モデルの API キー
まず、Ollama をインストールし、ハードウェアに適したモデルをプルします。 Qwen 3.x および Gemma 4 モデルにはさまざまなサイズがあり、現時点では、そのうちの 1 つから始めることをお勧めします。
次に、Jan をダウンロードしてインストールし、それを Ollama インスタンスに指定して、モデルにアクセスできるようにします。 Ollama アドレスの末尾に /v1 を追加する必要があることに注意してください。そうしないと、Jan はアドレスを読み取れなくなります。
したがって、入力するのではなく、 http://ローカルホスト:11434 入力する必要があります http://ローカルホスト:11434/v1 その代わり。
それが機能したら、設定に Anthropic API 接続を追加するだけです。
Anthropic コンソールで毎月の支出上限を設定すると、推論ループが予想よりも長く実行されて、予想外の高額な請求が発生することがなくなります。
AI の未来はハイブリッドです
私はますます多くのワークフローにローカル AI を使用してきました。 2 年前、地元の AI コーディング エージェントは控えめに言っても期待外れでした。現在、ローカル モデルは、5070Ti 上で実行したいことを正確に実行する、整然とした小さな Python コード セグメントを生成できます。また、スクリーンショットを記述し、仕様シートから情報を抽出する AI モデルもいくつかあります。
最も難しい問題については今でもクロードに相談しますが、地元では達成できないと思われることの数は減少しています。
関連情報は以下のリンクからご確認いただけます