Modelos

Curso gratuito ensina a criar aplicativos de IA locais com Python e RAG

5 de outubro de 2026 · 2 min de leitura

Também publicado em Svenska, Norsk

man standing beside another sitting man using computer
Proxyclick Visitor Management System / Unsplash

Um curso de sete aulas oferece um assistente que busca em documentos locais, responde a perguntas e exibe trechos originais para verificação. O projeto, chamado local‑docs‑ai, permite ao usuário colocar arquivos em uma pasta, fazer uma pergunta e receber respostas geradas por modelos de linguagem. Cada resposta inclui os trechos de texto consultados, com nomes de arquivos e números de linhas, para que o usuário possa conferir a origem da informação.

O curso foi desenvolvido para quem já conhece funções, listas e dicionários em Python. Primeiro, o aluno executa um exemplo pronto, depois analisa o código e aprende a distinguir dois tipos de falhas: quando a busca não encontra o fragmento correto ou quando o modelo interpreta o conteúdo de forma equivocada. O repositório disponibiliza todo o código e as sete aulas em um único local.

A arquitetura utiliza duas modelos carregadas via Ollama: embeddinggemma, que converte o texto em vetores para busca, e qwen3:1.7b, que gera a resposta final. Ambas são acessadas por meio da API local em O núcleo da aplicação está no arquivo docqa.py, que usa apenas a biblioteca padrão (pathlib, hashlib, json, math, urllib.request) e depende da biblioteca Streamlit para a interface web, cuja versão é fixada no requirements.txt.

Limites impostos pelo projeto incluem até 50 arquivos suportados e um total de 1 000 000 de bytes de conteúdo, excluindo PDFs. Esses limites permitem que o índice de busca seja mantido inteiramente na memória, facilitando a execução em máquinas com recursos modestos.

Nas primeiras aulas, o aluno instala Python 3.10 ou superior, Git e Ollama, e verifica a disponibilidade das modelos com o comando doctor, que consulta /api/tags para listar os modelos instalados. Se alguma estiver ausente, o script sugere o comando ollama pull correspondente. Posteriormente, o usuário testa a busca com um documento de exemplo, verifica se o número da linha mencionado está presente e avalia se a resposta do modelo corresponde ao conteúdo esperado.

O curso também aborda a granularidade dos fragmentos: o texto é dividido em blocos de até 1 000 caracteres, preservando números de linha originais, embora essa abordagem possa perder contexto quando linhas longas são cortadas. O tutorial demonstra como inspecionar esses blocos sem depender dos modelos, permitindo ao desenvolvedor ajustar parâmetros antes de integrar a geração de respostas.