7月17日、WAIC 2026の開幕初日、海康威視はマルチモーダルスマートカメラを重点的に発表し、「一言でカメラを働かせることができる」ことを実現した。例えば、ダムの安全管理シーンの中で、伝統的なカメラが見ているのは「人」と「水域」であるが、任務を設定したマルチモーダルスマートカメラはリスクエリアをリアルタイムで監視することができるだけでなく、シーン中の人物、状態と環境を正確に記述することができるだけでなく、シーンをより理解し、「人が泳ぐには溺水リスクがある」と判断し、自主的にラッパを連動させて警告を出すことができる。この「聞き取れる、理解できる、実行できる」能力は、ビデオカメラがアクティブサービスの「スマートアシスタント」に進化していることを示している。
この突破は、多モード大モデルとエッジ計算アーキテクチャの深い融合のおかげである。海康威視の担当者は「多モード大モデルをこのコンパクトなボディに組み込み、正確に感知できるだけでなく、迅速に認知、判断、応答できるようにした。近水注意のようなことが安全であり、リアルタイム性に対する要求が高いシーンに適している」と紹介した。従来のカメラよりも、多モードスマートカメラはより強いシーン理解能力、より柔軟なタスク配置方式、よりリアルタイムなエッジ処理能力を備えている。
具体的には、従来のカメラは画面の中に何があるのか、単一の視覚モデルを搭載したカメラは画面の中に何があるのかを見ることができるだけだが、人間の言語命令には応えられない。多モードスマートカメラは多モード能力を通じて、3つの飛躍を実現した:1つはインタラクティブなアップグレードであり、複雑な規則の作成から直接需要を言い出すまで、第二に、アップグレードを理解し、「群れがいる」ことから「彼らは泳いでいる、リスクがある」ことを理解すること、第三に、意思決定のグレードアップ、受動警報から能動連動音響光学、通知管理制御に至る。
特筆すべきは、マルチモーダルスマートカメラは自然言語の制御をサポートし、業務効率を効果的に向上させることができる。安全な生産シーンに応用することを例に、ユーザーは「反射衣を着ずに施工区に入った人は警察に通報してください」などの自然言語を入力するだけで、システムはすぐにそれを動的な配置規則に転化し、端側のリアルタイムビデオストリームが目標に合致すると、直ちに警報をトリガし、連動音響光、門限などの周辺機器をサポートする。受動的検索から能動的防御まで、事後検証から事中介入まで、閉ループ管理を実現する。
WAIC 2026海康威視展示エリアでは、観客はこのような「手に触れることができる」知能を自ら体験することもできる。画面上の見出しをクリックして、「これはどんなシーンですか。シーン中のリスク行為を分析します」や「画面中に水泳をしている人がいるかどうかを検出します。もしあれば、警告します」などのように、マルチモーダルスマートカメラは動画内容を自動的に分析し、画面上でリアルタイムに図文問答結果、アラート情報を生成し、連動して音声アラームを出して「ここは水泳を禁止しています。できるだけ早く離れてください」と提示します。
このデモンストレーションは、図文理解と自然言語の相互作用における海康威視の実力を直観的に示しただけでなく、大きなモデルは「読める」だけでなく、「会話ができる」「仕事ができる」ことを現場の視聴者に実感させ、本当に現場のシーンに根付くことができる知恵のアシスタントである。
ダムの近水注意から工場の安全生産、都市管理からスマート小売まで……過去には多くのスマート分析シーンがネットワーク帯域幅やクラウドコンピューティングコストに制限されており、現実的には対応できなかった。海康威視は知能物連分野での深い蓄積によって、AI技術のエッジ端での着地を持続的に推進してきた。現在のマルチモーダルスマートカメラの発表は、AI能力が業界応用の最後の1キロまで沈下できることを示しており、これは千行百業のデジタル化の転換に、澎湃たる新しい運動エネルギーを注入するだろう。