CloudflareがAIエージェント向けOSSと推論効率化技術を同日公開しました。
Cloudflareが3つの新技術公開
Cloudflareは2026年8月3日、AIエージェント向けオープンソースライブラリ「@cloudflare/computer」の早期プレビュー版を公開しました。同日、推論サービス「Workers AI」でKimi K2.6とGLM 5.2の推論効率を大幅に改善する技術も発表しています。
- AIエージェント用仮想コンピューター環境のOSS公開
- KVキャッシュ量子化で処理量約41%増・コスト約30%減
- モデル容量を705GBから421GBへ約40%削減
Cloudflareは2026年8月3日、AIエージェントにファイルシステムとコード実行環境を提供するOSS「@cloudflare/computer」を公開しました。同時に、Workers AIでKimi K2.6とGLM 5.2の量子化・圧縮による推論効率化も発表し、コスト削減と処理能力向上を両立しています。
詳しく見てみると
Cloudflareは2026年8月3日、AIエージェント向けオープンソースライブラリ「@cloudflare/computer」の早期プレビュー版を公開しました。このライブラリは、AIエージェントが利用するファイルシステムと複数のツール・コード実行環境をまとめて提供するもので、MITライセンスで公開されています。Agent HarnessからMCPを介した外部サービス接続、ブラウザーによるWeb参照、コンテナ内でのコマンド実行を1つの論理的な作業用コンピューターとして利用できます。
アーキテクチャ面では、従来のエージェント全体をコンテナで動かす構成から、軽量な「Isolate」上でAgent Harnessを動かし、必要な処理だけをコンテナに任せる構成への移行を示しています。これにより、起動時間や計算資源・運用コストの増加を抑えながら、コンテナの柔軟性を維持します。作業状態はDurable ObjectsのSQLiteに保存されるため、実行環境が再起動しても前回の作業内容を引き継げます。
同日公開されたWorkers AIの技術解説では、Moonshot AIの「Kimi K2.6」とZ.aiの「GLM 5.2」を対象に推論効率化の手法を紹介しています。Kimi K2.6ではKVキャッシュを16ビットから8ビットへ量子化した結果、保存できる文脈量が約68万6000トークンから約137万トークンへ倍増し、64件の同時処理が可能となりました。処理量は約41%増加、トークン当たりコストは約30%減少しています。
GLM 5.2ではモデル本体の数値データを8ビットから4ビットへ圧縮し、モデル容量を705GBから421GBへ約40%削減しました。Cloudflareによると、両モデルとも量子化・圧縮後の評価で実質的な性能低下は確認されませんでした。また、複数リクエストがGPU上のキャッシュを共有する際に誤ったデータを参照しないための検査機能も導入しており、処理性能への影響は1%未満です。
AIエージェント開発を支える信頼性の高いホスティング環境を探していますか?
AIエージェントや大規模Webサービスの運用には、安定したサーバー基盤が欠かせません。ConoHa WINGは高速・高安定性のクラウドホスティングとして多くの開発者に選ばれています。
ConoHa WINGで始める高速ホスティング
国内最速クラスの表示速度 / 簡単セットアップ / 充実のサポート体制
※本記事のリンクはアフィリエイト広告を含みます
Q&A
- @cloudflare/computerがMITライセンスで早期プレビュー公開
- Kimi K2.6の同時処理量が約41%増・コストが約30%減
- GLM 5.2のモデル容量が705GBから421GBへ約40%削減




















































コメント