この記事でわかること
  • AIエージェント用仮想コンピューター環境のOSS公開
  • KVキャッシュ量子化で処理量約41%増・コスト約30%減
  • モデル容量を705GBから421GBへ約40%削減
CloudflareAIエージェントWorkers AIオープンソース

Cloudflareは2026年8月3日、AIエージェントにファイルシステムとコード実行環境を提供するOSS「@cloudflare/computer」を公開しました。同時に、Workers AIでKimi K2.6とGLM 5.2の量子化・圧縮による推論効率化も発表し、コスト削減と処理能力向上を両立しています。

詳しく見てみると

Cloudflareは2026年8月3日、AIエージェント向けオープンソースライブラリ「@cloudflare/computer」の早期プレビュー版を公開しました。このライブラリは、AIエージェントが利用するファイルシステムと複数のツール・コード実行環境をまとめて提供するもので、MITライセンスで公開されています。Agent HarnessからMCPを介した外部サービス接続、ブラウザーによるWeb参照、コンテナ内でのコマンド実行を1つの論理的な作業用コンピューターとして利用できます。

アーキテクチャ面では、従来のエージェント全体をコンテナで動かす構成から、軽量な「Isolate」上でAgent Harnessを動かし、必要な処理だけをコンテナに任せる構成への移行を示しています。これにより、起動時間や計算資源・運用コストの増加を抑えながら、コンテナの柔軟性を維持します。作業状態はDurable ObjectsのSQLiteに保存されるため、実行環境が再起動しても前回の作業内容を引き継げます。

同日公開されたWorkers AIの技術解説では、Moonshot AIの「Kimi K2.6」とZ.aiの「GLM 5.2」を対象に推論効率化の手法を紹介しています。Kimi K2.6ではKVキャッシュを16ビットから8ビットへ量子化した結果、保存できる文脈量が約68万6000トークンから約137万トークンへ倍増し、64件の同時処理が可能となりました。処理量は約41%増加、トークン当たりコストは約30%減少しています。

GLM 5.2ではモデル本体の数値データを8ビットから4ビットへ圧縮し、モデル容量を705GBから421GBへ約40%削減しました。Cloudflareによると、両モデルとも量子化・圧縮後の評価で実質的な性能低下は確認されませんでした。また、複数リクエストがGPU上のキャッシュを共有する際に誤ったデータを参照しないための検査機能も導入しており、処理性能への影響は1%未満です。

PR

AIエージェント開発を支える信頼性の高いホスティング環境を探していますか?

AIエージェントや大規模Webサービスの運用には、安定したサーバー基盤が欠かせません。ConoHa WINGは高速・高安定性のクラウドホスティングとして多くの開発者に選ばれています。

おすすめサービス

ConoHa WINGで始める高速ホスティング

国内最速クラスの表示速度 / 簡単セットアップ / 充実のサポート体制

ConoHa WINGを詳しく見る
公式サイトを確認する

※本記事のリンクはアフィリエイト広告を含みます

Q&A

@cloudflare/computerは現在どのライセンスで公開されていますか?
@cloudflare/computerはMITライセンスで公式GitHubリポジトリに公開されています。ただし現時点では早期プレビュー版であり、APIや設計は今後変更される可能性があります。
ConoHa WINGはAI関連のWebアプリやAPIサーバーの運用に向いていますか?
ConoHa WINGは高速なSSD環境と安定したネットワークを提供しており、AIを活用したWebアプリやAPIエンドポイントのホスティングにも活用されています。詳細はConoHa WING公式サイトでご確認ください。
ConoHa WINGの初期費用や月額料金はどのくらいですか?
ConoHa WINGはプランや契約期間によって料金が異なります。キャンペーン割引が実施されることもあるため、最新の料金は公式サイトをご確認いただくことをおすすめします。
この記事のまとめ
  1. @cloudflare/computerがMITライセンスで早期プレビュー公開
  2. Kimi K2.6の同時処理量が約41%増・コストが約30%減
  3. GLM 5.2のモデル容量が705GBから421GBへ約40%削減
なうらぼ編集部より

Cloudflareが2026年8月3日に発表した内容は、AIエージェントの「動かす環境」と「推論コスト」という2つの課題に同時にアプローチするものでした。どちらも地味に見えて、実際にAIサービスを運用する立場からすると非常に重要なテーマです。

@cloudflare/computerが面白いのは、エージェント全体をコンテナに押し込めるのではなく、軽量なIsolateを中心に据えてコンテナを「必要なときだけ使う」設計にしている点です。大量のエージェントを同時に走らせることを前提にすると、この設計思想は運用コストに直結します。Cloudflareのエージェント基盤について詳しく調べることで、実際の導入事例や技術詳細をさらに深掘りできます。

Kimi K2.6とGLM 5.2の量子化・圧縮の話も見逃せません。KVキャッシュを16ビットから8ビットに落とすだけで、処理量が約41%増え、トークン当たりのコストが約30%減ったという結果は、モデルの大規模化が進む中でいかにメモリ効率が重要かを示しています。GLM 5.2に至っては705GBのモデルを421GBまで圧縮し、性能低下もほぼなかったと報告されています。

AIインフラの競争は、モデルの賢さだけでなく「いかに安く・速く・安全に動かすか」へと移っています。AIエージェントの推論効率化トレンドを調べるという視点で各社の取り組みを比較すると、Cloudflareのアプローチが業界全体の中でどう位置づけられるかがよく見えてきます。セキュリティ面でキャッシュの誤参照を防ぐ検査機能まで入れているのは、商用利用を意識した堅実な判断です。

関連商品を探す

楽天市場でAI・クラウド関連書籍を探す

国内最速クラスの表示速度 / 簡単セットアップ / 充実のサポート体制

楽天市場で今すぐ検索する

※広告・PR含む