联系我们

课程大纲

Gemini 3多模态简介

  • 涵盖文本、图像、音频和视频的能力
  • 模型选择与接口概览
  • 多模态推理的关键概念

处理文本与结构化输入

  • 文本生成的提示策略
  • 元数据、上下文窗口和嵌入
  • 基于文本的多模态任务编排

图像理解与视觉工作流

  • 使用Gemini 3进行图像分析与解读
  • 创建视觉搜索和标签工具
  • 构建图文互转交互功能

音频输入处理

  • 语音识别与转录工作流
  • 音频事件检测与解读
  • 音频与文本、视觉输入的集成

视频智能与场景分析

  • 逐帧与连续视频推理
  • 构建摘要生成与高光提取工具
  • 基于视频的自动化与内容工作流

设计多模态应用架构

  • 在单一流水线中组合多种输入类型
  • 考虑延迟、成本和计算资源
  • 可扩展多模态系统的最佳实践

多模态应用原型设计

  • 动手创建多模态原型
  • 通过提示工程进行快速迭代
  • 测试和优化用户体验流程

部署多模态解决方案

  • 部署策略与环境配置
  • 监控实际运行表现
  • 安全与合规性考量

总结与后续步骤

要求

  • 理解现代AI概念
  • 具备Python或JavaScript开发经验
  • 熟悉REST API

目标受众

  • 设计师
  • 内容创作者
  • 技术产品团队
 14 小时

客户评论 (1)

即将举行的公开课程

课程分类