Gemini
Endpoint: https://mmu.vod-qcloud.com/v1인증: VOD ApiToken / Bearer
기본 정보
| 항목 | 값 |
|---|---|
| 호출 주소 | https://mmu.vod-qcloud.com |
| 인증 | VOD 애플리케이션에서 발급한 ApiToken / Bearer |
| 출력 | 텍스트 / 구조화된 응답 |
| 응답 방식 | JSON / SSE |
지원 프로토콜
| 규격 | 경로 | 대상 |
|---|---|---|
| Chat Completions | POST /v1/chat/completions | 아래 모든 모델 |
| Messages | POST /v1/messages | 아래 모든 모델 |
아래 모델 ID에 해당 규격을 사용합니다. 인증과 공통 필드는 API Reference를 따릅니다.
샘플링 옵션
이 문서에 나열된 모든 모델에 공통으로 적용됩니다.
| 파라미터 | 설정 |
|---|---|
temperature | 설정 가능 |
top_p | 설정 가능 |
temperature는 샘플링 온도, top_p는 누적 확률 범위를 지정합니다. 한 가지 방식을 중심으로 조정합니다.
버전별 추론 설정
| 모델 ID | 설정 방식 | 비활성화 |
|---|---|---|
gemini-3.8-flash | thinking_enabled | false |
gemini-3.7-flash | thinking_enabled | false |
gemini-3.6-flash | thinking_enabled | false |
gemini-3.5-flash-lite | 추론 텍스트 미반환 | — |
gemini-3.5-flash | thinking_enabled | false |
gemini-3.1-pro-preview | thinking_enabled | false |
gemini-3.1-flash-lite-preview | 추론 텍스트 미반환 | — |
gemini-3.1-flash-lite | 추론 텍스트 미반환 | — |
gemini-3-flash-preview | thinking_enabled | false |
gemini-2.5-pro | thinking_enabled | false |
gemini-2.5-flash | thinking_enabled | false |
Chat Completions 기준입니다. 추론 내용은 reasoning_content, 최종 답변은 content에서 읽습니다. 비활성화할 수 없는 버전에는 비활성화 옵션을 전달하지 않습니다.
요청 파라미터
| 파라미터 | 필수 | 타입 | 설명 |
|---|---|---|---|
model | 필수 | String | 버전별 옵션 표의 모델 ID |
messages | 필수 | Array | Chat Completions / Messages의 대화 입력 |
max_tokens | 선택 | Integer | Chat Completions / Messages의 생성 한도. Messages에서는 필수 |
stream | 선택 | Boolean | true: SSE / false: JSON |
요청 예시
Chat Completions
{
"model": "gemini-3.8-flash",
"messages": [
{
"role": "user",
"content": "Reply with exactly OK and nothing else."
}
],
"max_tokens": 2048,
"stream": false,
"reasoning_effort": "low"
}응답
{
"id": "01a0de40-61b3-783f-afbb-eb22dda5c73b",
"object": "chat.completion",
"model": "gemini-3.8-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "OK",
"extra_content": {
"google": {
"thought_signature": "AY89a1+xrShbzLWCg3rEDSySoUYNiYV2NT1Spwa10pKOomiWkE/4JygxGm5cFuuesYhb5cXvKbkL3D/+85niNN/dJ+cYS1O2XguW/Kc0Ufu9FGdUMg=="
}
}
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 8,
"prompt_tokens_details": {
"audio_tokens": 0,
"cached_tokens": 0,
"text_tokens": 8
},
"prompt_cached_tokens_details": {
"audio_tokens": 0
},
"completion_tokens": 1,
"completion_tokens_details": {
"accepted_prediction_tokens": 0,
"audio_tokens": 0,
"reasoning_tokens": 0,
"rejected_prediction_tokens": 0
},
"total_tokens": 9
}
}Messages
{
"model": "gemini-3.8-flash",
"messages": [
{
"role": "user",
"content": "Reply with exactly OK and nothing else."
}
],
"max_tokens": 512,
"stream": false
}응답
{
"id": "01a0de33-1cf6-7971-8721-674043b69557",
"model": "gemini-3.8-flash",
"type": "message",
"role": "assistant",
"content": [
{
"text": "OK",
"type": "text"
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 8,
"output_tokens": 111
}
}특수 설정
Gemini는 텍스트 / 이미지 / 영상 / 오디오 입력을 지원합니다. 이미지에는 image_url, 영상에는 video_url Part를 사용합니다. 멀티모달 입력도 텍스트 호출과 동일한 인증 및 경로를 사용합니다.
추론 결과와 최종 답변은 reasoning_content와 content로 구분합니다. 도구 호출 응답의 thought_signature는 다음 대화 요청에서도 보존합니다.
버전별 추가 옵션
추론 강도
| 버전 | reasoning_effort | 기본값 |
|---|---|---|
3.8 / 3.7 Flash | low / medium / high | medium |
3.6 / 3.5 Flash | minimal / low / medium / high | medium |
3.5 / 3.1 Flash Lite | minimal / low / medium / high | minimal |
3.1 Pro | low / medium / high | high |
Gemini 3 이상은 기본 추론을 끌 수 없습니다. thinking_enabled=false를 공통 예시에 섞지 않습니다.
영상 / 오디오 입력은 Gemini Media Understanding을 참고합니다.
영상 및 오디오 입력
기본 정보
| 항목 | 값 |
|---|---|
| 모델 | gemini-3.8-flash |
| 입력 | 텍스트 / 이미지 / 영상 / 오디오 |
| 출력 | 텍스트 |
| 영상 입력 | video_url.url, 요청당 최대 10개 |
| 스트리밍 | 지원 |
요청 파라미터
| 파라미터 | 필수 | 타입 | 설명 |
|---|---|---|---|
model | 필수 | String | gemini-3.8-flash |
messages | 필수 | Array | 질문과 영상 Part |
max_tokens | 선택 | Integer | 추론을 포함한 최대 생성 토큰 |
reasoning_effort | 선택 | String | low / medium / high |
temperature | 선택 | Number | 생성 무작위성 |
stream | 선택 | Boolean | SSE 스트리밍 여부 |
요청 예시
{
"model": "gemini-3.8-flash",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "영상의 주요 피사체와 움직임을 한 문장으로 설명하세요."
},
{
"type": "video_url",
"video_url": {
"url": "https://example.com/video.mp4"
}
}
]
}
],
"max_tokens": 2048,
"reasoning_effort": "medium",
"temperature": 0.7,
"stream": false
}특수 설정
영상 구간과 샘플링
Gemini의 extra_content.google은 fps / media_resolution / start_offset / end_offset을 지원합니다. 시간 오프셋은 {seconds, nanos} 구조입니다. 샘플링 빈도를 높이면 짧은 움직임을 더 많이 포착하지만 입력 토큰도 늘어납니다.
추론과 출력 길이
추론 토큰도 max_tokens에 포함됩니다. 영상 분석에 비해 토큰 한도가 작으면 최종 설명이 중간에 끝날 수 있습니다. 버전별 추론 강도와 전체 모델 ID는 Gemini Text를 참고합니다.
응답 예시
{
"object": "chat.completion",
"model": "gemini-3.8-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "빨간색 스포츠카가 젖은 도심 도로를 따라 앞으로 이동합니다."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 923,
"completion_tokens": 220,
"total_tokens": 1143
}
}