注意: この記事の内容について、私は一切の責任を負えません。
安全に充分に注意し、各自の責任において判断して下さい。
AI は法令と利用規約と公序良俗を守って適切に利用しましょう。

GPT -> Claude -> オープン ウェイト モデルのローカル PC 稼働
私は OpenAI ChatGPT GPT-5 シリーズが嫌で 2025 年 12 月半ばに Anthropic Claude に乗り換えたのですが、Opus 4.7 以降に多くの問題に直面し、Opus 5 も使用していて大きなストレスを感じていました。
そこで、まずは 2026 年 8 月 31 日にミドル タワー型メイン PC で統合開発環境である VS Code に拡張機能の Llama-Vscode と llama.cpp + Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF を導入してみました。
加えて Brave Search MCP Server でウェブ検索機能を利用する為に Brave Search API にアカウントを作成し、API キーを発行しました。
試してみた感覚ですが、Qwen3.6-35B-A3B-Uncensored-Wasserstein-GGUF は性格や振る舞いは最高でした。
但し、性能については簡単なタスクならば問題無く遂行可能な水準ですが、間違いはやや多く、複雑な作業は出来なさそうでした。
因みに Qwen3.6-35B-A3B-Uncensored.Q4_K_P.gguf かつ最大電力制限を 140 W に引き下げるよう設定した GeForce RTX 4070 SUPER 12GB VRAM と 64 GB RAM の環境で 44 tokens/second の応答速度でしたので、速度面での不満は有りません。
しかし、GPU, VRAM を使い切るので、他の重いタスクとの並行利用は困難です。
Cline + クラウド AI 呼び出しへ

そこで、2026 年 9 月 1 日に VS Code に拡張機能の Cline を導入し、クラウド型 AI インフラストラクチャー サーヴィスの DeepInfra にアカウントを登録、AI モデル利用の API キーを発行し、Cline で GLM-5.3-Flash + Brave Search MCP Server で AI エージェントを利用する環境を構築しました。
GLM-5.3-Flash は充分に開発が可能な性能であり、性格も悪くなさそうです。
Brave Search API によるウェブ検索も充分な性能とインデックスを持っているようです。

但し、ここで注意すべきは安全性です。
Anthropic Claude Opus 5 でさえ度々暴走し、支離滅裂な挙動をしたり、curl 実行時に許可無く勝手に私の個人用 e-mail アドレスを User-Agent 文字列に付けて 12 の不特定多数のウェブサイトへ送信したり、ワークスペース外の私の PC 内を検索してファイルを調べたようとしたり、私が嫌がる発言をしたり、無断で Docker コンテナーを操作したりしましたから、より小型のオープン ウェイト モデルかつ自由な環境ではより一層安全性に注意が必要です。
AI エージェントの安全対策
安全性の為に VS Code Cline サイドバーからの GLM-5.3-Flash 呼び出しでは全てのアクションで私の承認を求めるように設定してあります。
そして、BubbleWrap で隔離した Cline CLI エージェントからの GLM-5.3-Flash 呼び出しではアクセス可能な範囲と実行の範囲を絞り込み、自動承認に設定しました。
VS Code Cline サイドバーの親 AI エージェントにタスクのブリーフを書かせ、BubbleWrap と子 AI エージェントの起動スクリプトを実行させます。
子エージェントはブリーフをプロンプトとして読み、目標を達成するまで連続稼働で試行錯誤を繰り返して仕事をこなします。
タスクを完遂したら報告書を書き、タスク完了を告げる空のマーカー ファイルを作成します。
これで比較的安全かつ快適に AI エージェントにタスクを丸投げ出来るようになりました。
子 AI エージェント達は膨大な試行錯誤を超高速に自律実行してくれます。
世間では OpenAI の GPT-6 Astra や Anthropic Claude Fable 5.1 が人気ですが、私は私が完全にコントロール出来る AI エージェント環境を作りました。
勿論かつての様な妨害工作も受けません。
ホスティング サーヴィスを Fireworks AI に乗り換え
2026年9月12日に AI モデル ホスティング サーヴィスを DeepInfra から Fireworks AI に変更しました。
理由は DeepInfra からのモデルの応答が余りにも遅かった事です。
DeepInfra のウェブ ダッシュボードによると TTFT (Time To First Token) が 120 秒、Tokens Per Second が 15 Tokens / Second という異常な遅さが頻発していました。
それはもう常用不能な水準でした。
一方で Fireworks AI に切り替えたらまさに桁違いの高速応答で快適でした。
時間効率まで含めると Claude Opus 5 よりもかなり効率的に感じられます。
Total : 173 files, 48738 codes, 4905 comments, 9563 blanks, all 63206 lines のリポジトリーを AI エージェントに丸投げで C++ ベースから Rust ベースに移植させるのも簡単でした。
因みに AI ホスティング サーヴィスを選ぶ際は安さだけでなくデータの安全性、所在国、プライヴァシー保護条件、データの取扱条件を調べるようにしましょう。
DeepInfra と Fireworks AI はその点では満足でした。

コメント