Gemini 3.7 Flash

Gemini 3.7 Flash od Google AI: $0.75 wejście i $3.75 wyjście za 1M tokenów, kontekst 1.0M. Wywołuj przez bramkę LLM odnogi.

ReasoningVisionToolsJSON modeStreaming

Gemini 3.7 Flash jest dostarczany przez Google AI i wywoływany przez odnogę tym samym formatem zgodnym z OpenAI, co każdy inny model w katalogu. To model rozumujący — zużywa dodatkowe tokeny wyjściowe na rozumowanie, więc przy trudnych zadaniach licz się z wyższym kosztem wyjścia. Przyjmuje obrazy obok tekstu. Obsługuje wywoływanie narzędzi i funkcji. Można wymusić zwracanie ustrukturyzowanego JSON-a. Okno kontekstu 1.0M tokenów wyznacza, ile wejścia zmieścisz w jednym wywołaniu. Pamięć podręczna wejścia kosztuje $0.075 za 1M tokenów, więc powtarzane prefiksy są tańsze.

Specyfikacja i cena

DostawcaGoogle AI
ID modelugemini-3.7-flash
Okno kontekstu1.0M tokenów
Maks. wyjście66K tokenów
MożliwościReasoning, Vision, Tools, JSON mode, Streaming
Twój plan
Za 1M tokenówKoszt dostawcyTwoja cena na planie Free+7%
Wejście$0.75$0.806
Wyjście$3.75$4.03
Pamięć podręczna wejścia$0.075$0.081

Koszt dostawcy to cena katalogowa za milion tokenów zapisana w katalogu odnoga; Twoja cena stosuje marżę planu tym samym wzorem, który rozlicza każdy request — zobacz cennik. Cennik

Wywołaj przez odnogę

const res = await fetch("https://api.odnoga.com/v1/chat/completions", {
  method: "POST",
  headers: {
    Authorization: `Bearer ${process.env.ODNOGA_API_KEY}`,
    "Content-Type": "application/json",
  },
  body: JSON.stringify({
    model: "gemini-3.7-flash",
    messages: [{ role: "user", content: "Hello" }],
  }),
});

Ten sam format wywołania dla każdego dostawcy — zmieniasz identyfikator modelu, a odnoga zajmuje się kluczami, routingiem, limitami i rozliczeniem kosztów.

Jak używać Gemini 3.7 Flash

Zweryfikowano 2026-09-14

Najlepszy do

  • Praca agentowa na skalę: Google pozycjonuje go jako wydajnego konia roboczego rodziny Gemini 3, mocnego w generowaniu kodu i pracy w terminalu.
  • Duży ruch produkcyjny, gdzie mimo wszystko chcesz mieć rozumowanie.
  • Bardzo duże wejścia — około miliona tokenów kontekstu, w tym długie dokumenty i całe repozytoria.
  • Wejście multimodalne: tekst i obrazy w jednym requeście.

Nie wybieraj go, gdy

  • Najgłębsze problemy rozumowania, gdzie właściwą odpowiedzią jest model Gemini klasy Pro.
  • Bardzo tania masowa klasyfikacja — poziom Flash-Lite kosztuje mniej.
  • Obciążenia przypięte do id modelu w wersji preview, które może się zmienić; na produkcji wybierz stabilne id.

Praktyczne wskazówki dla odnogi

  1. 01Traktuj go jako domyślny w układzie Gemini i eskaluj do poziomu Pro tylko to, co nie przejdzie ewaluacji.
  2. 02Trzymaj długi, stały kontekst na początku, by cache kontekstu obniżył koszt powtórzeń.
  3. 03Wysyłaj obrazy tylko wtedy, gdy zmieniają odpowiedź; tokeny obrazu to realne tokeny.
  4. 04Przypnij dokładne id modelu w wersji promptu — Google szybko wydaje kolejne odsłony Flash, a zamrożona wersja utrzymuje porównywalność ewaluacji.

Ile kosztuje miesiąc

1 000 wywołań miesięcznie, po 10 000 tokenów wejścia i 2 000 tokenów wyjścia, w Twojej cenie na planie Free (koszt dostawcy +7%):

Wejście (10M tokenów)$8.06
Wyjście (2M tokenów)$8.06
Twój koszt miesięcznie na planie Free$16.13

Koszt katalogowy dostawcy $15.00 + marża odnogi $1.13 (+7%). Pamięć podręczna wejścia lub ponowne użycie odpowiedzi ją obniża; odnoga zapisuje obie wartości dla każdego requestu.

Gemini 3.7 Flash w porównaniu

ModelKontekstWejście / 1MWyjście / 1MMożliwości
Gemini 3.7 Flash1.0M$0.75$3.75Reasoning, Vision, Tools, JSON mode, Streaming
Gemini 2.5 Computer Use131K$1$5Vision, Tools, JSON mode, Streaming
Gemini 2.5 Flash Image (Nano Banana)33K$0.3$2.50Vision

Pytania

Gdzie Gemini 3.7 Flash mieści się w rodzinie?
Google opisuje go jako wydajny i opłacalny model rodziny Gemini 3 — główny koń roboczy zadań agentowych między modelami Pro do głębokiego rozumowania a poziomem Flash-Lite o dużej przepustowości.
Czy nadaje się do agentów programistycznych?
Google wskazuje generowanie kodu i wykonywanie w terminalu jako główne postępy tej wersji. Zweryfikuj to na własnych zadaniach z repozytorium w laboratorium ewaluacji, zanim przełączysz agenta.
Jak uczciwie porównać go z modelem Claude lub GPT?
Zamroź te same przypadki testowe i uruchom w odnoga od 2 do 8 modeli. Dostaniesz jedną tabelę ze zdawalnością, tokenami, opóźnieniem i kosztem per model — na Twoich promptach, nie na publicznych benchmarkach.

Wszystkie modele · Cennik · Dokumentacja · Porównaj modele w laboratorium ewaluacji

Źródła: Google DeepMind — Gemini 3.7 Flash model card, Google Cloud — developer guide to Gemini 3.7 Flash

Jedna bramka, każdy model.