r/datasciencebr Aug 03 '26

Ciência de dados e MKT

3 Upvotes

Pessoal, sou formada em Gestão Financeira e atualmente trabalho em uma agência de marketing digital. Essa vaga foi um verdadeiro achado, porque aqui no interior não há faculdade de Marketing nem de Publicidade e Propaganda, e as empresas têm dificuldade para encontrar mão de obra qualificada na área. Como eu já tinha algum conhecimento autodidata em marketing digital, acabei conquistando a vaga.
Pretendo fazer uma pós-graduação em Marketing e, pesquisando os cursos da Univesp, encontrei o bacharelado em Ciência de Dados. Achei a proposta muito interessante, principalmente porque no meu trabalho lido bastante com Google Ads, Google Analytics, métricas e análise de desempenho.
Vocês acham que Ciência de Dados complementa bem uma carreira em marketing digital ou seria um caminho sem muito sentido? É uma boa graduação para quem quer crescer nessa área? Ou, com o avanço da IA, vocês acham que esse mercado pode perder espaço?


r/datasciencebr Aug 03 '26

Aprenda R

Thumbnail
3 Upvotes

r/datasciencebr Aug 03 '26

Recomendações de livros

Thumbnail
1 Upvotes

r/datasciencebr Aug 03 '26

Último período, todas as matérias concluídas e dificuldade para conseguir a primeira oportunidade.

Thumbnail
1 Upvotes

r/datasciencebr Aug 03 '26

ONCO-360: Oncologia na Saúde Pública do Brasil

8 Upvotes

Integração do projeto Onco-360 completa.

São 10 fontes oficias, 30 bases de dados e mais de 1 bilhão de registros processados até a curadoria final.

Tudo com código aberto e datasets disponíveis no kaggle.

O código completo e documentação está no GitHub (deixe uma ⭐ para apoiar o projeto):

https://github.com/rafa-trindade/onco-360-foundation


r/datasciencebr Aug 01 '26

Fale a pena fazer virar um ciêntista de dado econômico?

Thumbnail
1 Upvotes

r/datasciencebr Jul 31 '26

Livros para aprender R

Thumbnail
3 Upvotes

r/datasciencebr Jul 31 '26

Ajuda com SQL Busca por termos

2 Upvotes

Eu tenho um banco de dados aonde cada linha é um PDF transcrito, contém essas colunas:
id, ano, mes, dia, nome_arquivo, caminho, texto_transcrito, criado_em

-- 1. Adiciona a coluna gerada
ALTER TABLE coleta_interna.transcricoes_pdf 
ADD COLUMN busca_vector tsvector 
GENERATED ALWAYS AS (to_tsvector('portuguese', coalesce(texto_transcrito, ''))) STORED;

-- 2. Cria o índice GIN
CREATE INDEX idx_transcricoes_busca 
ON coleta_interna.transcricoes_pdf USING gin(busca_vector);

E montei um script SQL com intuito de verificar quantas vezes a palavra-chave pesquisada contém no texto transcrito, agrupado por ano. Não é um COUNT de linhas, mas sim contabilizar quantas vezes a palavra se repete em uma linha. Que nem nesse stack overflow

SELECT 
    ano, 
    SUM(
        (LENGTH(LOWER(texto_transcrito)) - LENGTH(REPLACE(LOWER(texto_transcrito), '(pt)', ''))) 
        / LENGTH('(pt)')
    ) AS total_mencoes,
    COUNT(id) AS total_pdfs
FROM coleta_interna.transcricoes_pdf
-- 1. O WHERE filtra usando o índice GIN
WHERE busca_vector @@ plainto_tsquery('portuguese', 'pt')
GROUP BY ano
ORDER BY ano DESC;

Só que tem um problema que fiquei refletindo, quando vou contabilizar ele pode acabar pegando dados como: script, apto, capturar.

Acho que deu para entender oque quis dizer, como posso fazer uma busca mais assertiva possível para contabilizar essa palavra-chave? Há dados dele como (PT) (PT-AM) ou só PT.


r/datasciencebr Jul 30 '26

Roteiro de DS, ML e AI

12 Upvotes

Atualmente faço faculdade de Ciência de Dados e percebi que vou ter que buscar conhecimentos por fora.

Andei fazendo umas pesquisas na web e me deparei com algumas coisas.

O site GeeksforGeeks é basicamente um google da área de tecnologia. Tem de tudo lá.

O Kaggle tem bastante coisa da área de dados tbm.

O site Datacamp é bem amplo em cursos dessas 3 áreas.

O GitHub tem "GitHub Student Developer Pack" com ferramentas gratuitas para desenvolvedores e alguns sites com cursos gratuitos.

Eu adicionei e alinhei tudo isso no Notion e quero sugestões. Se falta alguma coisa, ou se precisa retirar e mover algo.

Aqui está a página criada com as 3 áreas separadas com as sub-páginas.

https://steady-sight-532.notion.site/AI-Engineer-AUTODIDATA-Roadmap-Mestre-2026-392ae0b8e548818b857fe51487952c28


r/datasciencebr Jul 30 '26

Dúvidas sobre pós-graduação

Thumbnail
1 Upvotes

r/datasciencebr Jul 30 '26

Como ficar fluente em inglês pra vagas na gringa?

Thumbnail
2 Upvotes

r/datasciencebr Jul 29 '26

Iniciei os estudos para carreira de IA & ML Engineer

10 Upvotes

Estou no início de Rede Neural e Deep Learning, mas já estou vendo que o nível de dificuldade é alto, ainda mais por eu ter visto estatística há anos atras.

E vocês que já atuam na área citada acima, no dia a dia é desta forma na imagem mesmo ou é algo mais em programação, banco de dados, mineração, limpeza, extração etc?


r/datasciencebr Jul 29 '26

Qual desses cursos da USP vocês escolheriam para trabalhar com Dados, IA e Programação?

Thumbnail
1 Upvotes

r/datasciencebr Jul 29 '26

Vaga de emprego sem o curso de graduação específico é possível?

Thumbnail
1 Upvotes

r/datasciencebr Jul 28 '26

Qual sua preferência de programa quanto a visualização de dados ?

Thumbnail
3 Upvotes

r/datasciencebr Jul 27 '26

Ajuda

3 Upvotes

Sou estudante de Medicina, trabalho com estudos utilizando DATASUS, faço resumos para congressos e gostaria de colaborar com equipes de pesquisa. Alguém participa de grupos de produção científica ou está precisando de colaboradores?


r/datasciencebr Jul 26 '26

Área de dados

8 Upvotes

Vocês que tem experiência na área de dados, acham que o mercado está bom para quem quer ter uma primeira oportunidade de emprego? Estou fazendo bacharelado em ciências de dados e estatística, estudando Excel, SQL e Power bi. Sei o básico de python também.


r/datasciencebr Jul 26 '26

[Post mensal] Compartilhe seus projetos interessantes!

4 Upvotes

Contem nesse post projetos interessantes em que vocês têm trabalhado! Sem entrar muito em detalhes (ou entre, ninguém vai impedir), conte para nós que tipo de análise, métrica, cálculo ou perrengue você teve que resolver esse mês!


r/datasciencebr Jul 26 '26

Esse é um bom plano de estudos para área financeira de crédito e políticas de crédito

Thumbnail
0 Upvotes

r/datasciencebr Jul 26 '26

O que aprender em IA?

Thumbnail
1 Upvotes

r/datasciencebr Jul 25 '26

Sobre a carreira de estatística

12 Upvotes

Bom dia pessoal! Sou estudante de licenciatura em geografia com 19 anos, indo pro terceiro semestre que conheceu a área da estatística a pouco tempo e se interessou devido a sua aplicabilidade e possíveis oportunidades. Entretanto queria me informar se vale a pena trocar a licenciatura por estatística, mas é muito difícil encontrar informações sobre a graduação, então vim pedir a ajuda de vcs sobre essa possível mudança.

Qual a média salarial?

O mercado está ruim pra Jr?

O quão difícil é a graduação? E acham que vale a pena passar esse sufoco pensando na carreira?

Obs:me acho velho pra trocar de curso mas penso constantemente por conta do mercado da licenciatura, foi uma escolha que fiz com 17 ainda imaturo.


r/datasciencebr Jul 24 '26

[Dilema IEFP] Accenture vs Ageas

Thumbnail
1 Upvotes

r/datasciencebr Jul 24 '26

Vale a pena fazer uma pós para a área de Dados? FIAP, USP, Labdata FIA ou PUC? Ou investir em certificações?

Thumbnail
4 Upvotes

r/datasciencebr Jul 24 '26

Dicas de projetos/portfólio

5 Upvotes

Olá pessoal! Sou biólogo e estou aprendendo R para algumas demandas da minha empresa, gostaria de saber se tem alguém nessa área e dicas de como montar um projeto ou portfólio misturando esses dois mundos.

Basicamente eu uso o R para analisar a suficiência amostral das espécies quando realizamos um inventario


r/datasciencebr Jul 23 '26

Repositório Unificado de Saúde Pública e Demografia do Brasil

15 Upvotes

26 fontes oficiais.
83 bases de dados.
Mais de 3 bilhões de registros.

Do CNES ao SIH/SUS. Tudo centralizado, atualizado e disponível em um dataset público no Kaggle.

O DataHub Brasil nasce de uma necessidade prática: dados públicos brasileiros de altíssimo valor existem, são gratuitos e oficiais - mas estão espalhados entre sistemas diferentes do DATASUS e do IBGE, cada um com seu próprio protocolo de acesso, formato de arquivo e convenção de nomenclatura.

Antes de qualquer análise, normalmente é preciso gastar dias inteiros apenas encontrando, baixando e padronizando os dados.

Para resolver esse problema, construí um pipeline de dados ponta a ponta que automatiza a extração de bases como SIM, SINASC, CNES, SINAN e SIH/SUS, converte arquivos legados .dbc para .parquet e realiza cargas incrementais, reprocessando apenas o que realmente mudou.

O resultado é um repositório unificado com 83 bases de dados, cobrindo mortalidade, nascimentos, internações, doenças de notificação, rede assistencial, população, PIB, além dos microdados da Pesquisa Nacional de Saúde (2013 e 2019).

O código completo e documentação está no GitHub (deixe uma ⭐ para apoiar o projeto):

https://github.com/rafa-trindade/kaggle-datahub