구글 제미나이 3.6 Flash·3.5 Flash-Lite 총정리 — 성능·가격·속도 완벽 비교
목차
구글이 2026년 7월, AI 에이전트 시대를 정조준한 새 제미나이(Gemini) 모델 세 종을 한꺼번에 공개했습니다. 비용과 속도를 끌어올린 주력 모델 Gemini 3.6 Flash, 라인업에서 가장 빠른 경량 모델 Gemini 3.5 Flash-Lite, 그리고 보안에 특화되어 제한적으로 배포되는 Gemini 3.5 Flash Cyber입니다. 이번 글에서는 세 모델의 성능·가격·속도를 한눈에 비교하고, 실무에서 어떤 모델을 언제 선택해야 하는지까지 정리해 드립니다.
구글 제미나이 신규 3종, 한눈에 비교
세 모델은 각각 다른 목표에 맞춰 설계됐습니다. 3.6 Flash는 '지능은 유지하되 더 싸고 빠르게', 3.5 Flash-Lite는 '속도와 가성비 극대화', 3.5 Flash Cyber는 '보안 특화'입니다. 핵심 수치를 표로 정리하면 다음과 같습니다.
| 구분 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash Cyber |
|---|---|---|---|
| 포지션 | 주력(균형형) | 초고속 경량 | 사이버 보안 특화 |
| 지능(Intelligence Index) | 50점 유지 | 36점(+11) | 비공개 |
| 속도 | 작업당 2.7분 → 1.3분 | 초당 350토큰(최고속) | 비공개 |
| 가격(입력, 1M 토큰당) | $1.50 | $0.30 | 제한 배포 |
| 가격(출력, 1M 토큰당) | $7.50 | $2.50 | 제한 배포 |
| 배포 | 일반 공개 | 일반 공개 | 정부·신뢰 파트너 한정 |
지능 점수는 독립 벤치마크 기관 Artificial Analysis의 Intelligence Index 기준이며, 가격·속도 수치는 구글 공식 발표를 바탕으로 합니다. 아래에서 모델별로 자세히 살펴보겠습니다.
제미나이 3.6 Flash: 더 빠르고 저렴해진 주력 모델
지능은 유지, 효율은 대폭 개선
3.6 Flash는 전작인 3.5 Flash와 동일한 Intelligence Index 50점을 유지하면서도 효율을 크게 끌어올린 것이 핵심입니다. 같은 지능 수준을 유지했다는 것은, 답변 품질을 떨어뜨리지 않으면서 비용과 속도만 개선했다는 의미여서 실무 활용도가 높습니다.
가격과 속도
구글 발표에 따르면 동일 작업 기준 처리 시간이 약 2.7분에서 1.3분으로 절반가량(약 51%) 단축됐고, 출력 토큰 사용량이 17%가량 줄면서 비용도 약 18% 감소했습니다. 공개 가격은 100만 토큰당 입력 $1.50, 출력 $7.50입니다. 토큰 효율이 좋아진 만큼 같은 작업을 더 적은 비용으로 처리할 수 있습니다.
코딩 성능(DeepSWE)
코딩 능력을 측정하는 DeepSWE 벤치마크에서는 3.5 Flash의 37%에서 49%로 향상됐습니다. 코드 작성·수정 같은 개발 보조 작업에서 체감 성능이 올라간 셈입니다.

제미나이 3.5 Flash-Lite: 속도와 가성비의 극한
초당 350토큰, 라인업 최고 속도
Flash-Lite는 이름 그대로 '가벼움'에 초점을 맞춘 모델입니다. 초당 약 350토큰을 출력해 이번 라인업에서 가장 빠르며, 작업당 처리 시간도 1.0분에서 0.6분으로 40%가량 줄었습니다. 대량의 요청을 빠르게 처리해야 하는 상황이나 에이전트가 반복적으로 검색·호출하는 작업에 적합합니다.
지능 점수 11점 상승
단순히 빠르기만 한 것이 아니라, Intelligence Index가 이전보다 11점 오른 36점을 기록했습니다. 경량 모델치고 지능 개선 폭이 커서 '싸고 빠른데 그럭저럭 똑똑한' 선택지로서 매력이 커졌습니다.
어떤 작업에 적합한가
가격은 100만 토큰당 입력 $0.30, 출력 $2.50으로 3.6 Flash의 약 5분의 1에서 3분의 1 수준입니다. 요약·분류·간단한 응답 생성처럼 초고난도 추론이 필요 없는 대량 작업이라면 Flash-Lite로 비용을 크게 아낄 수 있습니다.
제미나이 3.5 Flash Cyber: 보안 특화 제한 모델
세 번째 모델인 Flash Cyber는 일반 사용자가 바로 쓸 수 있는 모델이 아닙니다. 사이버 보안에 특화되어 구글의 보안 취약점 탐지·수정 에이전트 인프라인 'CodeMender'와 통합되며, 정부 기관과 신뢰할 수 있는 파트너에게만 제한적으로 배포됩니다. 취약점 분석처럼 오·남용 위험이 큰 영역을 통제된 환경에서 다루려는 의도로 풀이됩니다.
구버전 대비 비용 변화
이번 신규 모델의 API 요금을 이전 세대와 비교하면 다음과 같습니다. 가격은 100만 토큰당(USD) 기준입니다.
| 구분 | 이전 버전 (입력 / 출력) | 현재 버전 (입력 / 출력) | 변화 |
|---|---|---|---|
| 3.6 Flash (← 3.5 Flash) | $1.50 / $9.00 | $1.50 / $7.50 | 입력 동일, 출력 약 17% 인하 |
| 3.5 Flash-Lite (← 3.1 Flash-Lite) | $0.25 / $1.50 | $0.30 / $2.50 | 입력 +20%, 출력 +67% |
3.6 Flash는 입력 단가는 3.5 Flash와 같지만 출력 단가가 $9.00에서 $7.50으로 내렸고, 에이전트 루프·코드 생성 같은 멀티스텝 작업에서는 토큰 소모 자체가 줄어 실질 동작 비용이 최대 60%까지 절감됩니다. 반면 3.5 Flash-Lite는 이전 3.1 Flash-Lite보다 정가는 소폭 올랐지만 속도(초당 약 350토큰)와 지능(Intelligence Index +11)이 크게 향상돼 성능 대비 비용은 여전히 라인업 최저 수준입니다. 특히 3.6 Flash보다 입력 단가가 약 80% 저렴해 대량·고트래픽 작업에는 Flash-Lite가 가장 경제적입니다.
Standard Flash와 Flash-Lite, 무엇이 다른가
같은 Flash 계열이라도 표준 Flash(3.6·3.5)와 경량 Flash-Lite(3.5·3.1)는 속도와 품질에서 뚜렷한 차이가 있습니다. 단순히 '싼 모델과 비싼 모델'의 관계가 아니라, 목적이 다른 두 가지 도구로 이해하는 편이 정확합니다.
속도·지연 시간
Flash-Lite는 토큰 생성 속도가 초당 약 350~380개로 표준 Flash보다 50~60% 이상 빠르고, 첫 토큰이 나오기까지 걸리는 시간(TTFT)도 짧습니다. 실시간 채팅이나 자동완성처럼 즉각적인 반응이 중요한 서비스에 특히 유리합니다.
품질·정확도
| 구분 | Standard Flash (3.6·3.5) | Flash-Lite (3.5·3.1) |
|---|---|---|
| 추론·복잡 문제 | 다단계 논리 추론, 코드 리팩토링, 복잡한 지시 이행에 우수 | 단순 분류, 요약, 정규화 작업에 우수 |
| 사실성(그라운딩) | 상대적으로 높은 팩트 유지력(~50% 수준) | 팩트·검색 기반 응답이 상대적으로 약함(~40% 수준) |
| 모호한 프롬프트 | 추상적·모호한 지시도 의도를 파악해 구체화 | 정형화된 프롬프트엔 잘 작동, 모호하면 평범한 응답 |
| 에이전트(도구 호출) | 여러 도구를 연속 호출하는 작업 성공률이 높음 | 단순 단일 도구 호출에 적합 |
정리하면
Flash-Lite는 대규모 데이터 분류·추출·변환, 실시간 챗봇·자동완성·간단한 요약, 그리고 사용자 입력의 난이도를 1차로 판별하는 '스마트 라우터'에 적합합니다. 표준 Flash는 여러 API·도구를 연속으로 호출하는 에이전트 작업, 코드 생성·리뷰 같은 기술 작업, 그리고 환각을 줄이고 제공된 문서에 근거해 답해야 하는 검색 결합(RAG) 문서 QA에 적합합니다.
어떤 모델을 언제 써야 할까
세 모델은 경쟁 관계라기보다 용도가 다른 선택지에 가깝습니다. 실무 관점에서 정리하면 다음과 같습니다.
- 품질과 비용의 균형이 필요하다면 → 3.6 Flash. 복잡한 추론·코딩·멀티모달 작업의 기본값으로 적합합니다.
- 속도와 비용이 최우선이라면 → 3.5 Flash-Lite. 대량 요청, 실시간 응답, 에이전트의 반복 호출에 유리합니다.
- 보안 취약점 분석 등 특수 목적이라면 → 3.5 Flash Cyber. 단, 일반 접근은 제한됩니다.
다른 최신 AI 모델과의 사용법 비교가 궁금하다면 Grok 4.5 사용법 정리도 함께 참고해 보세요.
가격과 벤치마크 수치는 2026년 7월 발표 시점 기준이며, 이후 조정될 수 있습니다. 실제 도입 전에는 반드시 구글 공식 가격 페이지에서 최신 요금과 지역별 제공 여부를 확인하세요.
앞으로의 로드맵: 3.5 Pro와 Gemini 4
구글은 이번 Flash 라인업과 별개로 상위 모델 Gemini 3.5 Pro를 파트너 대상으로 테스트 중이며, 차세대 모델인 Gemini 4 개발도 함께 진행하고 있다고 밝혔습니다. 자세한 내용은 구글 딥마인드 공식 블로그에서 확인할 수 있습니다. 에이전트 중심으로 모델 라인업이 세분화되는 흐름이 당분간 이어질 것으로 보입니다.
자주 묻는 질문
Q. 제미나이 3.6 Flash와 3.5 Flash의 가장 큰 차이는 무엇인가요?
지능 점수(Intelligence Index 50점)는 동일하게 유지하면서 처리 속도를 약 51% 단축하고 비용을 약 18% 낮춘 것이 핵심 차이입니다. 즉 같은 품질을 더 빠르고 저렴하게 제공합니다.
Q. Flash-Lite는 3.6 Flash보다 성능이 많이 떨어지나요?
Flash-Lite는 Intelligence Index 36점으로 3.6 Flash(50점)보다 낮지만, 속도가 초당 350토큰으로 가장 빠르고 가격이 3분의 1 이하입니다. 고난도 추론보다는 대량·실시간 처리에 맞춘 모델이라 용도가 다릅니다.
Q. Flash Cyber는 일반 사용자도 쓸 수 있나요?
아니요. Flash Cyber는 사이버 보안에 특화된 모델로, 정부 기관과 신뢰할 수 있는 파트너에게만 제한적으로 배포됩니다. 일반 API로는 제공되지 않습니다.
Q. 어떤 모델부터 써보는 것이 좋을까요?
대부분의 일반적인 작업에는 균형이 좋은 3.6 Flash가 무난합니다. 요약·분류처럼 단순하고 양이 많은 작업이거나 비용을 최대한 아끼고 싶다면 3.5 Flash-Lite를 먼저 시험해 보는 것을 추천합니다.