
多模态模型的接入复杂度,往往来自协议不兼容、接口不统一、文档不完整等问题。VITA API兼容OpenAI Completions API协议,可直接使用OpenAI SDK进行接入,降低了接入成本,使企业能够相对快速地完成多模态理解能力的集成。
不同厂商的多模态模型,往往采用不同的API协议和接口规范。企业在接入时,需要针对每个模型分别开发对接代码,学习其鉴权方式、请求参数结构、返回参数结构等。当企业需要使用多个模型、或在模型之间进行切换时,这种协议不兼容的问题会进一步放大接入工作量。
此外,协议不兼容也意味着企业无法直接在已有代码基础上进行少量修改来完成接入,而是需要重新开发一套对接逻辑。这对于已经基于某种协议(如OpenAI API协议)开发了多模态功能的业务而言,意味着较大的代码重构工作量。
传统多模态理解方案依赖多个单模态模型串联成工作流,再由末端模块汇总结果。这种架构在接入阶段就需要完成多个模型的对接、调试与集成工作,每个模型都有其独立的API接口、鉴权方式和参数规范。
多个模型之间的数据传递和格式转换,也需要额外开发。例如,视觉编码器的输出格式需要与后续理解模块的输入格式相匹配,这往往需要编写额外的预处理和后处理代码。整体集成工作量较为可观。
VITA API兼容OpenAI Completions API协议,接口路径为/chat/completions,请求方式为POST。企业在接入VITA时,可直接参照OpenAI的接口规范来构造请求,无需学习一套全新的接口协议。
具体的接口信息如下:
https://tokenhub.tencentmaas.com/v1/chat/completions这种协议兼容性,使VITA能够直接融入基于OpenAI API协议开发的生态中,企业可利用现有的OpenAI SDK、工具和代码示例来完成接入。
VITA的请求参数结构与OpenAI Completions API对齐,主要参数包括:
model:模型名称,可选值vita-video-3.0、vita-video-long,在腾讯云TokenHub平台上也可使用youtu-vitamessages:需要理解的内容,结构参照OpenAI的messages参数stream:是否启用流式输出temperature:输出随机性top_p:输出多样性max_tokens:限制最大输出Token数在messages参数的content字段中,VITA使用type字段来区分不同类型的输入:text(文本指令)、image_url(图片)、video_url(视频)。这种参数设计与OpenAI的多模态接口规范一致,降低了学习成本。
VITA的返回参数结构也与OpenAI Completions API对齐,包括id、object、created、model、choices、usage等字段。企业可使用现有的OpenAI SDK直接解析VITA的返回结果,无需修改解析逻辑。
usage对象包含prompt_tokens、completion_tokens、total_tokens三个字段,与OpenAI的Token用量统计方式一致。这方便了企业对API调用成本进行监控和测算。
使用OpenAI Python SDK接入VITA,只需修改api_key和base_url两个参数,其余代码与调用OpenAI API时基本一致。以下是一个简单的示例:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://tokenhub.tencentmaas.com/v1"
)
response = client.chat.completions.create(
model="vita-video-long",
messages=[{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": "<video url>"}},
{"type": "text", "text": "请描述视频的内容"}
]}],
stream=False
)
print(response.choices[0].message.content)如果任务不需要处理音频,建议使用vita-video-3.0模型,以降低调用成本。
对于需要使用命令行工具进行测试的场景,可使用cURL直接向VITA API发送请求。以下是一个调用示例:
curl -X POST 'https://tokenhub.tencentmaas.com/v1/chat/completions' \
-H 'Authorization: Bearer YOUR_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "vita-video-3.0",
"messages": [{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": "<image url>"}},
{"type": "text", "text": "请描述图片的内容"}
]}],
"stream": false
}'cURL示例有助于企业在无代码环境下快速测试VITA的接口,验证请求构造和返回解析是否正确。
ADP(Application Development Platform)是腾讯云提供的低代码/无代码应用开发平台,支持通过可视化配置方式接入各类AI模型服务。对于不具备编程基础、或希望快速搭建原型的用户,ADP平台提供了无代码接入VITA的可行方案。
ADP平台与TokenHub平台的区别在于:ADP通过可视化界面配置,无需编写代码;TokenHub通过API接口调用,需要编程基础。企业可根据自身技术栈和场景需求,选择合适的接入方式。
通过ADP平台接入VITA,主要步骤包括:
https://tokenhub.tencentmaas.com/v1/chat/completions,请求方式POST,授权方式Bearer Tokenvita-video-3.0或vita-video-long)并配置Prompt整个配置过程通过可视化界面完成,无需编写代码,适合快速验证VITA的理解效果。
传统多模型拼接方案的上线周期通常为4–12周。在这段时间内,企业需要完成多个模型的选型、接入、调试、集成与测试工作。每个模型的接入都需要投入相应的开发资源,而多个模型之间的联调更增加了整体复杂度。
上线周期的拉长,不仅影响了业务上线速度,也增加了项目的整体成本。在市场竞争较为激烈的场景下,数周的上线延迟可能会对企业造成不利影响。
VITA的单模型端到端方案,使业务上线周期缩短至1–3天,整体上线耗时节约85%以上。上线周期的缩短来自多个方面:兼容OpenAI API协议降低了接入开发工作量、单模型方案简化了集成和调试工作、统一的接口规范减少了文档学习和问题排查时间。
1–3天的上线周期,使企业在进行多模态理解能力集成时,能够更快地完成从技术选型到功能上线的完整流程,从而更快地验证产品假设和迭代业务方案。
VITA提供两个可用模型,企业应根据自身任务需求选择合适的模型:
vita-video-3.0:支持视频画面(不含音频)和图片,若不需要处理音频,优先选择该模型vita-video-long:支持视频(含画面和音频)和图片,需要处理音频则选择该模型在腾讯云TokenHub平台上,模型名称也可使用youtu-vita,与vita-video-3.0/vita-video-long等价。
接入时需注意以下输入限制:
vita-video-long模型可直接处理视频中的音频对于超过100MB但不超过600MB的视频文件,可通过白名单形式申请处理权限。
为了获得较好的理解效果,建议在使用VITA时遵循以下Prompt编写建议:
VITA的官方接入文档位于腾讯云官网(https://cloud.tencent.com/document/product/1823/130988 ),涵盖了产品介绍、功能特性、API接口详细说明和使用场景等内容。企业在接入过程中,可参照官方文档完成接口对接和参数配置。
此外,腾讯云开发者社区中也有VITA相关的技术文章和案例分享,可为企业接入提供参考。
VITA API兼容OpenAI Completions API协议,可直接使用OpenAI SDK进行接入,业务上线周期缩短至1–3天。每个腾讯云账号可获100万免费Token额度,用于测试和接入。前往腾讯云TokenHub平台,体验VITA的多模态理解能力:https://console.cloud.tencent.com/tokenhub/multimodal?modelId=youtu-vita
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。