Ir para o conteúdo

Modelo de fundação

Origem: Wikipédia, a enciclopédia livre.

Na inteligência artificial, um Modelo de Fundação (em inglês: foundation model, abreviado FM), ou modelo de grande escala (large x model, LxM,[1] onde x é uma variável arbitrária para modalidades como texto, imagem, áudio, etc.), é sistema de aprendizado de máquina ou aprendizado profundo treinado com vastos volumes de dados de modo e, que pode ser adaptado para uso com uma ampla gama de tarefas específicas,[2][3] como por exemplos os sistemas de inteligência artificial generativa, como os grandes modelos de linguagem (LLMs).[2][3] Todo LLM é um Modelo de Fundação, mas nem todo Modelo de Fundação é um LLM.[3]

A criação de modelos de fundação exige volumes massivos de recursos computacionais e financeiros, com os modelos mais avançados demandando orçamentos na casa de centenas de milhões de dólares para aquisição, curadoria e processamento de dados em escala da Web, além do suprimento de infraestrutura energética e de processamento acelerado.[4] Tais custos decorrem de arquiteturas de computação distribuída, tempos prolongados de treino e clusters massivos de unidades de processamento gráfico (GPUs). Em contrapartida, a adaptação ou o uso direto de um modelo de fundação preexistente para uma tarefa especializada apresenta custo marginal consideravelmente inferior, visto que aproveita as representações pré-treinadas e exige apenas um ajuste fino (fine-tuning) sobre conjuntos de dados específicos e reduzidos.

Os primeiros exemplos influentes de modelos de fundação surgiram no processamento de linguagem natural, com a série GPT da OpenAI e o BERT do Google.[5][6] Para além do domínio textual, foram concebidos modelos em diversas modalidades sensoriais — abrangendo o DALL-E, o Stable Diffusion e, o Flamingo[7] para imagens e visão computacional; MusicGen[8] e LLark[9] para composição e análise musical; e o RT-2[10] para controle em robótica autônoma. Modelos de fundação também são construídos para áreas como astronomia,[11] radiologia médica,[12] oftalmologia,[13] genômica,[14] geociências,[15] síntese de código-fonte,[16] previsão de séries temporais,[17] matemática[18] e química computacional.[19]

Definições

[editar | editar código]

O Center for Research on Foundation Models (CRFM), vinculado ao Institute for Human-Centered Artificial Intelligence (HAI) da Universidade Stanford, cunhou formalmente o termo "modelo de fundação" em agosto de 2021,[20] definindo-o como "qualquer modelo treinado sobre uma ampla variedade de dados (geralmente por meio de aprendizado autosupervisionado em escala) capaz de ser adaptado (por exemplo, via ajuste fino) para um vasto leque de tarefas derivadas (downstream tasks)".[21] Os pesquisadores justificaram a introdução do termo indicando que as nomenclaturas anteriores eram imprecisas: "grande modelo de linguagem" era demasiadamente restritivo por limitar-se ao domínio do texto; "modelo autosupervisionado" vinculava-se estritamente ao objetivo matemático da função de perda; e "modelo pré-treinado" sugeria equivocadamente que as capacidades relevantes ocorriam exclusivamente após a fase de pré-treino.[22] A locução "modelo de fundação" (foundation model) foi preferida em detrimento de "modelo fundacional" (foundational model) pelo fato de o termo "fundacional" implicar a existência de princípios conceituais basilares e universais, algo que o conceito de fundação estrutural não pressupõe.[23][24] A designação modelo de visão e linguagem (VLM) é comumente empregada como sinônimo no campo multimodal.

Com o avanço das iniciativas regulatórias governamentais, surgiram definições jurídicas formais:

  • Nos Estados Unidos, a Ordem Executiva 14110 (posteriormente revogada) sobre o desenvolvimento de IA definia modelo de fundação como "um modelo de IA treinado em dados abrangentes; que geralmente utiliza aprendizado autosupervisionado; contém no mínimo dezenas de bilhões de parâmetros; e é aplicável a uma ampla gama de contextos".[25]
  • Também no ambiente legislativo norte-americano, o projeto de lei AI Foundation Model Transparency Act de 2023[26] estabeleceu que o conceito abrange "um modelo de inteligência artificial treinado em dados amplos, que geralmente emprega autosupervisão, possui habitualmente ao menos 1.000.000.000 de parâmetros, aplica-se a uma variedade de contextos e exibe, ou pode ser facilmente modificado para exibir, altos níveis de desempenho em tarefas que possam representar risco grave à segurança pública, à segurança econômica nacional ou à saúde pública".
  • Na União Europeia, o texto consolidado do Regulamento da IA (EU AI Act) categoriza-o como um "modelo de IA treinado em dados de grande escala, concebido para generalidade de saídas e apto a ser adaptado a uma vasta diversidade de tarefas distintas".
  • No Reino Unido, a autoridade regulatória de concorrência Competition and Markets Authority (CMA) define modelos de fundação como "um tipo de tecnologia de IA treinada sobre vastas quantidades de dados, capaz de adaptação a um amplo conjunto de tarefas e operações".[2]

As formulações jurídicas norte-americanas são as únicas que estipulam limites quantitativos explícitos quanto à contagem de parâmetros do sistema neural. Em contrapartida, a diretriz comunitária europeia enfatiza a concepção orientada para a generalidade de saídas. Todas as jurisdições convergem no critério de que o modelo deve ser treinado em um espectro heterogêneo de dados e apresentar flexibilidade de aplicação multisubjetiva.

História

[editar | editar código]

Sob o ponto de vista da computação, os modelos de fundação baseiam-se em paradigmas estabelecidos da ciência de dados, tais como redes neurais profundas, aprendizado por transferência e aprendizado autosupervisionado. Distinguem-se das arquiteturas de aprendizado de máquina convencionais por atuarem como uma infraestrutura computacional generalista e reutilizável, contrastando com os modelos projetados exclusivamente para tarefas pontuais e isoladas.

O desenvolvimento da computação paralela massiva (como as GPUs programadas em CUDA) e a introdução da arquitetura de redes neurais Transformer em 2017 viabilizaram a expansão dos modelos de fundação a partir do final da década de 2010.[27] Em comparação com os modelos supervisionados que dependiam de rotulagem manual extensiva de dados, os novos modelos demonstraram capacidade de aprendizado por meio de funções objetivas autosupervisionadas sobre corporações textuais em escala global extraídas da Internet (como a predição probabilística do próximo elemento em uma sequência). Essas técnicas evoluíram conceitualmente de modelos vetoriais de representação semântica anteriores, tais como o Word2vec e o GloVe.

O lançamento público do modelo gerador de imagens Stable Diffusion e do assistente conversacional ChatGPT em 2022 (baseado no modelo GPT-3.5) impulsionou a adoção massiva de modelos de fundação pela sociedade. Subsequentemente, o lançamento de modelos como LLaMA, Llama 2 e Mistral em 2023 estimulou discussões aprofundadas sobre governança, modelos de pesos abertos (código aberto)[28] e riscos associados à proliferação desregulada de sistemas com pesos livremente acessíveis.[29]

Conceitos correlatos

[editar | editar código]

Modelos de fronteira

[editar | editar código]

Determinados modelos de fundação dotados de capacidades operacionais muito avançadas são classificados na literatura como "modelos de fronteira" (frontier models), caracterizados pelo potencial de "exibir capacidades de alto risco com repercussão sobre a segurança pública e estabilidade institucional".[30] Essas capacidades críticas decorrem do potencial de uso malicioso deliberado ou de acidentes sistêmicos decorrentes de sua autonomia operacional.

Entre as capacidades avaliadas em protocolos de segurança para essa classificação, incluem-se:

  • Auxílio no planejamento e síntese de novos agentes patogênicos biológicos ou substâncias químicas bélicas;[31]
  • Produção e propagação automatizada de campanhas de desinformação hiperpersonalizadas com mínima intervenção humana;[32]
  • Execução autônoma de operações ofensivas avançadas em ciberguerra e invasão de redes computacionais críticas;[33]
  • Evasão de mecanismos de controle humano por meio de comportamentos estratégicos de dissimulação ou engano instrumental.[34]

Nos Estados Unidos, o Instituto de Segurança de IA do NIST vinculou a classificação de modelos de fronteira a patamares técnicos de operações computacionais de ponto flutuante (FLOPs) despendidas no treinamento.[35]

Devido à natureza emergente dessas propriedades, capacidades perigosas podem manifestar-se de modo não previsto tanto durante o treinamento quanto após a disponibilização do sistema.[30] Para mitigar riscos e estabelecer diretrizes de auditoria independente, consórcios setoriais como o Frontier Model Forum (fundado por OpenAI, Anthropic, Google e Microsoft)[36] e órgãos estatais multilaterais — como a Rede Internacional de Institutos de Segurança de IA (AISIs)[37] e o Processo de IA de Hiroshima do G7[38] — estruturaram protocolos de avaliação e relatórios de segurança técnica.

Inteligência artificial de uso geral

[editar | editar código]

Em virtude de sua adaptabilidade funcional, os modelos de fundação são frequentemente enquadrados na categoria de inteligência artificial de uso geral (GPAI, do inglês general-purpose AI). Ao debater o arcabouço regulatório do Regulamento da IA europeu, o Parlamento Europeu apontou que os sistemas de IA de uso geral constituem a camada primária de sustentação de todo o ecossistema tecnológico contemporâneo.[39] As características intrínsecas desses sistemas — incluindo escala maciça, opacidade operacional nas camadas ocultas e comportamentos emergentes — motivaram a inclusão de exigências de transparência técnica, governança de dados e testes de conformidade antes da distribuição de produtos derivados no mercado.[40]

Modelos de mundo

[editar | editar código]

Os modelos de mundo (world models) são concebidos por certos pesquisadores como extensões dos modelos de fundação.[41][42] Trata-se de representações dinâmicas de ambientes físicos ou virtuais concebidas para prever o estado futuro desse ambiente com base em ações executadas por um agente,[43][44] modelando implicitamente leis da física, como a gravidade, a inércia e a tridimensionalidade espacial.[44]

As instruções de entrada (prompts) para modelos de mundo podem incluir texto, imagens,[45][46] vídeos e malhas tridimensionais.[47] Ao lado da IA corporificada (embodied AI) e dos sistemas multiagente, os modelos de mundo são investigados como rotas alternativas aos grandes modelos de linguagem tradicionais na busca pela inteligência artificial geral (AGI).[48]

A literatura técnica divide as abordagens de modelos de mundo em dois eixos: compreensão e representação do estado presente do ambiente e previsão dos estados subsequentes. O primeiro viés adota aprendizado por reforço baseado em modelos e processo de decisão de Markov, utilizando métodos como o controle preditivo por modelo (MPC) ou a busca em árvore de Monte Carlo (MCTS). O segundo viés emprega redes multimodais e modelos generativos de vídeo orientados à simulação física contínua.[49]

Histórico

[editar | editar código]

As origens conceituais remontam aos estudos pioneiros de Kenneth Craik em 1943 sobre modelos mentais e ao micrormundo de blocos do sistema SHRDLU na década de 1960.[50] Em 1974, Marvin Minsky propôs o conceito de quadros mentais (frames) para organizar o conhecimento de mundo em máquinas.[49]

Em 2018, David Ha e Jürgen Schmidhuber formularam os modelos de mundo modernos no escopo do aprendizado por reforço: uma arquitetura integrando um autoencoder variacional (VAE, módulo V) para codificação visual, uma rede neural recorrente (RNN, módulo M) para memória temporal e um controlador linear (módulo C) para tomada de decisões, demonstrando que agentes treinados em ambientes virtuais simulados mantinham desempenho estável quando transferidos ao mundo real.[51]

Em 2022, Yann LeCun propôs os modelos de mundo como componentes integrados a uma arquitetura cognitiva modular com múltiplas redes neurais emulando áreas corticais do cérebro, argumentando que a representação hierárquica do ambiente é condição indispensável para dotar sistemas de IA de raciocínio de senso comum.[52][53]

Treinamento e implementações

[editar | editar código]

Modelos de mundo são alimentados por fluxos multimodais de dados (texto, imagens bidimensionais, telemetria sonora, dados de sensores e nuvens de pontos tridimensionais).[54] Plataformas abertas disponibilizam conjuntos de treino contendo até 1 bilhão de instâncias anotadas.[44]

Entre os modelos desenvolvidos destacam-se o gerador de vídeo Sora da OpenAI (caracterizado por alguns analistas como modelo de mundo incipiente);[54] o modelo Cosmos da Nvidia;[55][42] a plataforma de inteligência espacial da Manycore Tech;[56] as séries Genie 2 e Genie 3 da Google DeepMind (focadas em simulações interativas bi e tridimensionais);[57][58] os ambientes de simulação física da Meta Platforms;[59] o modelo de código aberto da Tencent;[60] e o modelo geoespacial da Niantic Spatial (alimentado por escaneamentos do jogo Pokémon GO).[61] Em novembro de 2025, a startup World Labs, cofundada por Fei-Fei Li, lançou o modelo comercial Marble, voltado à geração de mundos virtuais navegáveis tridimensionais com física interativa para a indústria de jogos e efeitos digitais.[62]

Preocupações e limitações

[editar | editar código]

Os modelos de mundo impõem requisitos computacionais de treino e inferência consideravelmente mais onerosos que os grandes modelos de linguagem puros.[53][54] Apresentam também vulnerabilidades a alucinações estruturais, vieses de amostragem no espaço de parâmetros e imprecisões no raciocínio têmporo-espacial físico.[54][63] Críticos e profissionais da economia criativa manifestam ressalvas quanto ao impacto potencial sobre postos de trabalho de animação gráfica e cinema,[64] enquanto juristas apontam controvérsias em torno de direito autoral sobre dados de varredura visual de espaços públicos e privacidade de dados espaciais.[49]

Detalhes técnicos

[editar | editar código]

Arquitetura

[editar | editar código]

Para adquirir capacidade de generalização representativa, os modelos de fundação exigem arquiteturas neurais altamente expressivas capazes de processar dados maciços em regime paralelo sem gargalos de gradiente.[21] A arquitetura Transformer, fundamentada em mecanismos de autoatenção (self-attention), estabeleceu-se como a abordagem hegemônica na concepção de modelos de fundação tanto no processamento de linguagem quanto em domínios de visão e multimodalidade.[65]

Treinamento

[editar | editar código]

O aprendizado de modelos de fundação baseia-se na otimização estocástica de uma função de perda que calcula a discrepância entre a previsão paramétrica do modelo e a amostra real durante o treinamento.[66]

  • Modelos de linguagem utilizam habitualmente a modelagem autorregressiva com objetivo de predição do próximo token (next-token prediction);
  • Modelos visuais e generativos empregam frequentemente aprendizado contrastivo ou formulações probabilísticas baseadas em difusão estocástica (onde a rede aprende a remover ruído gaussiano inserido incrementalmente na matriz de pixels);[67]
  • Modelos multimodais podem processar fluxos heterogêneos de forma sincronizada ou em camadas desacopladas de fusão representacional tardia.

O treinamento em grande escala orienta-se pela premissa empírica de expansão contínua do volume de dados (data scaling).[68] Contudo, a extração massiva de dados por raspagem na Web acarreta desafios severos de curadoria, incluindo a replicação de informações com toxicidade linguística, preconceitos históricos, conteúdo duplicado e infrações de direito autoral e privacidade de dados pessoais.[69][70]

Sistemas e computação

[editar | editar código]

Modelos de fundação com centenas de bilhões ou trilhões de parâmetros excedem substancialmente a capacidade de memória individual de um único acelerador computacional. Consequentemente, o treinamento exige arranjos de computação distribuída, combinando paralelismo de tensores, paralelismo de pipeline e paralelismo de dados sobre redes com comutadores de alta taxa de transferência (como conexões InfiniBand e barramentos NVLink). Para atenuar a demanda energética e os custos em tempo de inferência, os desenvolvedores recorrem a técnicas como quantização de precisão numérica, poda de pesos (pruning) e destilação de conhecimento.

Leis de escala

[editar | editar código]

A acurácia e a perda de entropia cruzada em modelos de fundação seguem trajetórias amplamente previsíveis correlacionadas ao aumento de três variáveis fundamentais: o orçamento total de operações de ponto flutuante computacionais ($C$), a quantidade de parâmetros da rede ($N$) e o volume de tokens de dados de treinamento ($D$). Esse comportamento segue leis de potência empíricas, conhecidas na literatura especializada como leis de escala de Chinchilla e Kaplan.

Contudo, pesquisas identificaram quebras nessas trajetórias regulares (broken neural scaling laws),[71] nas quais a curva de declínio de perda sofre transições abruptas em determinados limiares operacionais, dificultando a extrapolação teórica precisa de capacidades para modelos de dimensões extremas.

Adaptação

[editar | editar código]

Para direcionar um modelo de fundação a aplicações práticas específicas, empregam-se métodos de adaptação supervisionada e contextual:

  • Engenharia de prompt: Estruturação de instruções contextuais em linguagem natural sem alteração de parâmetros internos do modelo;
  • Aprendizado no contexto (in-context learning): Inserção de exemplos de demonstração diretamente na janela de contexto de inferência;
  • Ajuste fino completo (full fine-tuning): Recálculo e atualização de todos os pesos da rede sobre dados especializados;
  • Adaptação com eficiência de parâmetros (PEFT), como o método LoRA (Low-Rank Adaptation) e o BitFit,[72] que congelam os pesos originais do modelo e treinam apenas matrizes vetoriais de baixo posto adicionais, reduzindo significativamente o custo computacional.

Avaliação

[editar | editar código]

A mensuração das capacidades dos modelos de fundação baseia-se em baterias de testes padronizadas de referência (benchmarks), tais como:

  • MMLU (compreensão linguística e raciocínio multidisciplinar em nível universitário);[73]
  • MMMU (avaliação de raciocínio multimodal de nível especialista);[74]
  • HumanEval (geração e síntese de código funcional);[75]
  • GSM8K (resolução de problemas matemáticos e raciocínio lógico em múltiplos passos).[76]

Quadros de avaliação holística mais amplos — como o HELM (Holistic Evaluation of Language Models), o BIG-Bench e o HEIM (para geração de imagens) — examinam métricas complementares de robustez, calibração estatística, toxicidade e viés algorítmico.[77]

Cadeia de suprimentos

[editar | editar código]

A cadeia produtiva dos modelos de fundação abrange elos upstream (fornecimento de hardware, chips semicondutores e energia), etapas de compilação de dados, treinamento central e distribuição downstream (aplicações de consumo final).[2]

Estimativa de custo de treinamento computacional de modelos avançados de IA ao longo do tempo (Relatório AI Index 2024).[78]

Devido à barreira de capital necessária para viabilizar clusters de treinamento de ponta, o setor apresenta forte concentração de mercado em poucas empresas de tecnologia (como Microsoft, Alphabet, Amazon, Meta) e desenvolvedoras especializadas (OpenAI, Anthropic).[79] Em 2023, companhias do setor chegaram a despender mais de 80% do capital levantado na contratação de infraestrutura em nuvem e capacidade computacional.[80]

A preparação de dados para esses modelos emprega trabalhadores humanos na rotulagem e anotação contextual, bem como na filtragem de conteúdos de risco (processo denominado trabalho de dados ou data labor), frequentemente subcontratado em países em desenvolvimento sob remunerações reduzidas e exposição psicológica a materiais violentos ou abusivos.[81]

Estratégias de disponibilização

[editar | editar código]

A distribuição de um modelo de fundação concluído pode ocorrer por meio de diferentes arranjos de governança e acesso:[82][83]

  • Acesso fechado ou interno: O modelo opera exclusivamente dentro da infraestrutura do próprio desenvolvedor, sem disponibilização de pontos de extremidade públicos (como o modelo Flamingo da Google DeepMind);[84]
  • Acesso controlado via interface de programação de aplicações (API): O modelo funciona como uma caixa-preta comercialmente acessível; usuários enviam entradas e recebem saídas computadas remotamente nos servidores do fornecedor, mas não têm acesso direto aos parâmetros da rede nem ao código-fonte interno (a exemplo do GPT-4 da OpenAI);
  • Acesso aberto aos pesos (open-weights): Os parâmetros treinados da rede neural são publicados e disponibilizados para download irrestrito ou sob licenças de uso aceitável, permitindo execução local, auditorias externas de segurança e modificações analíticas pela comunidade de pesquisa (como as famílias LLaMA da Meta e os modelos Mistral).

Ver também

[editar | editar código]

Referências

[editar | editar código]
  1. ↑ «From Knowledge Graphs to Digital Twins: Perspectives on Modeling Patient Outcomes for Health Care Quality Assessment». Journal of Medical Internet Research (JMIR). 31 de março de 2026. Consultado em 16 de setembro de 2026
  2. 1 2 3 4 Competition and Markets Authority of United Kingdom (18 de setembro de 2023). «AI Foundation Models: Initial Report» (PDF). Consultado em 11 de dezembro de 2023. Cópia arquivada (PDF) em 11 de dezembro de 2023
  3. 1 2 3 «O que são modelos de fundação?». Google Cloud Discover. Consultado em 16 de setembro de 2026
  4. ↑ Nestor Maslej et al., "The AI Index 2023 Annual Report," AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, Stanford, Califórnia, abril de 2023.
  5. ↑ Rogers, Anna; Kovaleva, Olga; Rumshisky, Anna (2020). «A Primer in BERTology: What we know about how BERT works». arXiv:2002.12327Acessível livremente [cs.CL]
  6. ↑ Haddad, Mohammed. «How does GPT-4 work and how can you start using it in ChatGPT?». Al Jazeera (em inglês). Consultado em 20 de outubro de 2024. Cópia arquivada em 5 de julho de 2023
  7. ↑ Tackling multiple tasks with a single visual language model, 28 de abril de 2022, consultado em 13 de junho de 2022, cópia arquivada em 28 de abril de 2022
  8. ↑ Copet, Jade; Kreuk, Felix; Gat, Itai; Remez, Tal; Kant, David; Synnaeve, Gabriel; Adi, Yossi; Défossez, Alexandre (7 de novembro de 2023). «Simple and Controllable Music Generation». arXiv:2306.05284Acessível livremente [cs.SD]
  9. ↑ «LLark: A Multimodal Foundation Model for Music». Spotify Research (em inglês). 13 de outubro de 2023. Consultado em 11 de dezembro de 2023
  10. ↑ «Speaking robot: Our new AI model translates vision and language into robotic actions». Google (em inglês). 28 de julho de 2023. Consultado em 11 de dezembro de 2023. Cópia arquivada em 11 de dezembro de 2023
  11. ↑ Nguyen, Tuan Dung; Ting, Yuan-Sen; Ciucă, Ioana; O'Neill, Charlie; Sun, Ze-Chang; Jabłońska, Maja; Kruk, Sandor; Perkowski, Ernest; Miller, Jack (12 de setembro de 2023). «AstroLLaMA: Towards Specialized Foundation Models in Astronomy». arXiv:2309.06126Acessível livremente [astro-ph.IM]
  12. ↑ Tu, Tao; Azizi, Shekoofeh; Driess, Danny; Schaekermann, Mike; Amin, Mohamed; Chang, Pi-Chuan; Carroll, Andrew; Lau, Chuck; Tanno, Ryutaro (26 de julho de 2023). «Towards Generalist Biomedical AI». arXiv:2307.14334Acessível livremente [cs.CL]
  13. ↑ Judkiewicz, Raphael (2026). «Shifting the retinal foundation models paradigm from slices to volumes for optical coherence tomography». npj Digital Medicine (em inglês). doi:10.1038/s41746-026-02496-7Acessível livremente
  14. ↑ Zvyagin, Maxim; Brace, Alexander; Hippe, Kyle; Deng, Yuntian; Zhang, Bin; Bohorquez, Cindy Orozco; Clyde, Austin; Kale, Bharat; Perez-Rivera, Danilo (2023). 10.1101/2022.10.10.511571. «GenSLMs: Genome-scale language models reveal SARS-CoV-2 evolutionary dynamics». The International Journal of High Performance Computing Applications (em inglês). 37 (6): 683–705. doi:10.1177/10943420231201154
  15. ↑ Zhu, Xiao Xiang; Xiong, Zhitong; Wang, Yi; Stewart, Adam J.; Heidler, Konrad; Wang, Yuanyuan; Yuan, Zhenghang; Dujardin, Thomas; Xu, Qingsong; Shi, Yilei (8 de janeiro de 2026). «On the foundations of Earth foundation models». Communications Earth & Environment (em inglês). 7 (1). 103 páginas. ISSN 2662-4435. doi:10.1038/s43247-025-03127-xAcessível livremente. Consultado em 12 de julho de 2026. Cópia arquivada em 8 de janeiro de 2026
  16. ↑ Li, Raymond; Allal, Loubna Ben; Zi, Yangtian; Muennighoff, Niklas; Kocetkov, Denis; Mou, Chenghao; Marone, Marc; Akiki, Christopher; Li, Jia (9 de maio de 2023). «StarCoder: may the source be with you!». arXiv:2305.06161Acessível livremente [cs.CL]
  17. ↑ Se, Ksenia; Spektor, Ian (5 de abril de 2024). «Revolutionizing Time Series Forecasting: Interview with TimeGPT's creators». Turing Post (em inglês). Consultado em 11 de abril de 2024
  18. ↑ Azerbayev, Zhangir; Schoelkopf, Hailey; Paster, Keiran; Santos, Marco Dos; McAleer, Stephen; Jiang, Albert Q.; Deng, Jia; Biderman, Stella; Welleck, Sean (30 de novembro de 2023). «Llemma: An Open Language Model For Mathematics». arXiv:2310.10631Acessível livremente [cs.CL]
  19. ↑ «Orbital». Consultado em 5 de setembro de 2024. Cópia arquivada em 3 de setembro de 2024
  20. ↑ «Introducing the Center for Research on Foundation Models (CRFM)». Stanford HAI. 18 de agosto de 2021. Consultado em 11 de junho de 2022. Cópia arquivada em 4 de junho de 2023
  21. 1 2 Bommasani, Rishi; et al. (18 de agosto de 2021). On the Opportunities and Risks of Foundation Models (Relatório). arXiv:2108.07258Acessível livremente
  22. ↑ «Reflections on Foundation Models». Stanford HAI. 18 de outubro de 2021. Consultado em 22 de maio de 2023. Cópia arquivada em 15 de agosto de 2024
  23. ↑ Bommasani, Rishi; Liang, Percy (18 de outubro de 2021). «Reflections on Foundation Models». Stanford CRFM. Consultado em 11 de dezembro de 2023
  24. ↑ Marcus, Gary (11 de setembro de 2021). «Has AI found a new Foundation?». The Gradient (em inglês). Consultado em 11 de dezembro de 2023. Cópia arquivada em 11 de dezembro de 2023
  25. ↑ «Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence». The White House (em inglês). 30 de outubro de 2023. Consultado em 12 de fevereiro de 2024. Cópia arquivada em 1 de fevereiro de 2025
  26. ↑ «AI Foundation Model Transparency Act» (PDF). Consultado em 13 de fevereiro de 2024. Cópia arquivada (PDF) em 13 de fevereiro de 2024
  27. ↑ Liang, Percy (1 de outubro de 2023), «Holistic Evaluation of Language Models», Annals of the New York Academy of Sciences, 1525 (1): 140–146, Bibcode:2023NYASA1525..140B, PMID 37230490, arXiv:2211.09110Acessível livremente, doi:10.1111/nyas.15007
  28. ↑ «Joint Statement on AI Safety and Openness». Mozilla (em inglês). 31 de outubro de 2023. Consultado em 12 de fevereiro de 2024. Cópia arquivada em 4 de novembro de 2023
  29. ↑ «Hawley and Blumenthal Demand Answers from Meta, Warn of Misuse After 'Leak' of Meta's AI Model». Senator Josh Hawley (em inglês). 6 de junho de 2023. Consultado em 12 de fevereiro de 2024. Cópia arquivada em 13 de fevereiro de 2024
  30. 1 2 Anderljung, Markus (7 de novembro de 2023), Frontier AI Regulation: Managing Emerging Risks to Public Safety, arXiv:2307.03718Acessível livremente
  31. ↑ Singhal, Karan; et al. (agosto de 2023). «Large language models encode clinical knowledge». Nature. 620 (7972): 172–180. Bibcode:2023Natur.620..172S. ISSN 1476-4687. PMC 10396962Acessível livremente. PMID 37438534. arXiv:2212.13138Acessível livremente. doi:10.1038/s41586-023-06291-2
  32. ↑ Nori, Harsha (12 de abril de 2023), Capabilities of GPT-4 on Medical Challenge Problems, arXiv:2303.13375Acessível livremente
  33. ↑ «Generative AI and the New Frontier in Cybersecurity». AI Business (em inglês). 7 de fevereiro de 2024. Consultado em 15 de janeiro de 2025. Cópia arquivada em 20 de janeiro de 2025
  34. ↑ Pillay, Tharin (15 de dezembro de 2024). «New Tests Reveal AI's Capacity for Deception». TIME (em inglês). Consultado em 15 de janeiro de 2025. Cópia arquivada em 22 de abril de 2025
  35. ↑ «Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence». Federal Register (em inglês). 1 de novembro de 2023. Consultado em 20 de abril de 2026. Cópia arquivada em 29 de abril de 2026
  36. ↑ «About». Frontier Model Forum (em inglês). Consultado em 20 de abril de 2026. Cópia arquivada em 14 de abril de 2026
  37. ↑ Allen and Adamson (30 de outubro de 2024). «The AI Safety Institute International Network: Next Steps and Recommendations». CSIS- Center for Strategic and International Studies
  38. ↑ «Documents of Achievement | Hiroshima AI Process». www.soumu.go.jp. Consultado em 20 de abril de 2026
  39. ↑ «General-purpose artificial intelligence | Think Tank | European Parliament». www.europarl.europa.eu (em inglês). Consultado em 12 de fevereiro de 2024. Cópia arquivada em 13 de fevereiro de 2024
  40. ↑ Bommasani, Rishi (28 de março de 2023), Ecosystem Graphs: The Social Footprint of Foundation Models, arXiv:2303.15772Acessível livremente
  41. ↑ Bellan, Rebecca (5 de agosto de 2025). «DeepMind thinks its new Genie 3 world model presents a stepping stone toward AGI». TechCrunch (em inglês). Consultado em 8 de novembro de 2025. Cópia arquivada em 5 de agosto de 2025
  42. 1 2 Takahashi, Dean (7 de janeiro de 2025). «Nvidia launches Cosmos world foundation model platform to accelerate physical AI». VentureBeat (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 8 de janeiro de 2025
  43. ↑ Pearl, Mike (15 de novembro de 2025). «'Imagine a Cube Floating in the Air': The New AI Dream Allegedly Driving Yann LeCun Away from Meta». Gizmodo (em inglês). Consultado em 28 de novembro de 2025. Cópia arquivada em 16 de novembro de 2025
  44. 1 2 3 Fried, Ina (17 de novembro de 2025). «AI's next big leap is models that understand the world.». Axios (em inglês). Consultado em 28 de novembro de 2025. Cópia arquivada em 17 de novembro de 2025
  45. ↑ Husain, Mishal (21 de novembro de 2025). «The Godmother of AI Didn't Expect It to Be This Massive». Bloomberg News. Consultado em 28 de novembro de 2025
  46. ↑ Whitwam, Ryan (5 de agosto de 2025). «DeepMind reveals Genie 3 "world model" that creates real-time interactive simulations». Ars Technica (em inglês). Consultado em 28 de novembro de 2025. Cópia arquivada em 12 de setembro de 2025
  47. ↑ Pillay, Tharin (9 de dezembro de 2025). «Inside Fei-Fei Li's Plan to Build AI-Powered Virtual Worlds». TIME (em inglês). Consultado em 11 de dezembro de 2025. Cópia arquivada em 10 de dezembro de 2025
  48. ↑ Gelling, Peter; Varanasi, Lakshmi. «The AI doomers are having their moment». Business Insider (em inglês). Consultado em 14 de outubro de 2025. Cópia arquivada em 25 de agosto de 2025
  49. 1 2 3 Ding, Jingtao (9 de setembro de 2025). «Understanding World or Predicting Future? A Comprehensive Survey of World Models». ACM Computing Surveys. 58 (3): 57:1–57:38. ISSN 0360-0300. doi:10.1145/3746449Acessível livremente
  50. ↑ Pavlus, John (2 de setembro de 2025). «'World Models,' an Old Idea in AI, Mount a Comeback». Quanta Magazine (em inglês). Consultado em 14 de outubro de 2025. Cópia arquivada em 23 de setembro de 2025
  51. ↑ Ha, David; Schmidhuber, Jürgen (3 de dezembro de 2018). «Recurrent world models facilitate policy evolution». Red Hook, NY: Curran Associates Inc. Proceedings of the 32nd International Conference on Neural Information Processing Systems. NIPS'18: 2455–2467
  52. ↑ Heikkilä, Melissa; Douglas Heaven, Will (24 de junho de 2022). «Yann LeCun has a bold new vision for the future of AI». MIT Technology Review (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 24 de junho de 2022
  53. 1 2 Zeff, Maxwell (17 de outubro de 2024). «Meta's AI chief says world models are key to 'human-level AI' – but it might be 10 years out». TechCrunch (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 4 de março de 2025
  54. 1 2 3 4 Wiggers, Kyle (14 de dezembro de 2024). «What are AI 'world models,' and why do they matter?». TechCrunch (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 18 de março de 2025
  55. ↑ Wiggers, Kyle (7 de janeiro de 2025). «Nvidia releases its own brand of world models». TechCrunch (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 5 de março de 2025
  56. ↑ Chen, Wency (5 de maio de 2025). «China's answer to Autodesk is betting on AI to build a 'world model'». South China Morning Post (em inglês). Consultado em 15 de junho de 2025
  57. ↑ Orland, Kyle (5 de março de 2024). «Google's Genie game maker is what happens when AI watches 30K hrs of video games». Ars Technica (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 8 de dezembro de 2024
  58. ↑ Orland, Kyle (6 de dezembro de 2024). «Google's Genie 2 "world model" reveal leaves more questions than answers». Ars Technica (em inglês). Consultado em 15 de junho de 2025. Cópia arquivada em 7 de dezembro de 2024
  59. ↑ Browne, Ryan (11 de junho de 2025). «Meta launches AI 'world model' to advance robotics, self-driving cars». CNBC (em inglês). Consultado em 14 de outubro de 2025. Cópia arquivada em 27 de setembro de 2025
  60. ↑ Osawa, Juro; Liu, Qianer; Yang, Jing. «ByteDance's Upcoming 'World Model'; Altman's Thoughts on the GPT-5 Fiasco, Profitability, and Going Public». The Information (em inglês). Consultado em 14 de outubro de 2025
  61. ↑ Criddle, Cristina; Murphy, Hannah; Bradshaw, Tim (29 de setembro de 2025). «Big AI firms pump money into world models as LLM advances slow». Ars Technica (em inglês). Consultado em 14 de outubro de 2025
  62. ↑ Bellan, Rebecca (12 de novembro de 2025). «Fei-Fei Li's World Labs speeds up the world model race with Marble, its first commercial product». TechCrunch (em inglês). Consultado em 28 de novembro de 2025
  63. ↑ Orland, Kyle (1 de outubro de 2025). «Can today's AI video models accurately model how the real world works?». Ars Technica (em inglês). Consultado em 14 de outubro de 2025
  64. ↑ Wiggers, Kyle (28 de maio de 2025). «Odyssey's new AI model streams 3D interactive worlds». TechCrunch (em inglês). Consultado em 15 de junho de 2025
  65. ↑ Bommasani, Rishi (19 de outubro de 2023), The Foundation Model Transparency Index, arXiv:2310.12941Acessível livremente
  66. ↑ Claude Elwood, Shannon (julho de 1948). «A Mathematical Theory of Communication» (PDF). Bell System Technical Journal. Consultado em 13 de fevereiro de 2024. Cópia arquivada (PDF) em 4 de maio de 2025
  67. ↑ Radford, Alec (26 de fevereiro de 2021), Learning Transferable Visual Models From Natural Language Supervision, arXiv:2103.00020Acessível livremente
  68. ↑ Kaplan, Jared (22 de janeiro de 2020), Scaling Laws for Neural Language Models, arXiv:2001.08361Acessível livremente
  69. ↑ Jo, Eun Seo; Gebru, Timnit (27 de janeiro de 2020). «Lessons from archives: Strategies for collecting sociocultural data in machine learning». Proceedings of the 2020 Conference on Fairness, Accountability, and Transparency. [S.l.: s.n.] pp. 306–316. ISBN 978-1-4503-6936-7. arXiv:1912.10389Acessível livremente. doi:10.1145/3351095.3372829
  70. ↑ Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret (1 de março de 2021). «On the Dangers of Stochastic Parrots: Can Language Models be Too Big? 🦜». Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency. [S.l.]: Association for Computing Machinery. pp. 610–623. ISBN 978-1-4503-8309-7. doi:10.1145/3442188.3445922
  71. ↑ Ethan Caballero, Kshitij Gupta, Irina Rish, David Krueger (2022). "Broken Neural Scaling Laws". International Conference on Learning Representations (ICLR), 2023.
  72. ↑ Zaken, Elad Ben; Ravfogel, Shauli; Goldberg, Yoav (5 de setembro de 2022), BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models, arXiv:2106.10199Acessível livremente
  73. ↑ «Papers with Code – MMLU Benchmark (Multi-task Language Understanding)». paperswithcode.com (em inglês). Consultado em 21 de abril de 2024. Cópia arquivada em 13 de fevereiro de 2024
  74. ↑ Yue, Xiang (20 de dezembro de 2023), MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI, arXiv:2311.16502Acessível livremente
  75. ↑ «Papers with Code – HumanEval Benchmark (Code Generation)». paperswithcode.com (em inglês). Consultado em 21 de abril de 2024
  76. ↑ «Papers with Code – GSM8K Benchmark (Arithmetic Reasoning)». paperswithcode.com (em inglês). Consultado em 21 de abril de 2024. Cópia arquivada em 13 de fevereiro de 2024
  77. ↑ Linzen, Tal (julho de 2020). «How Can We Accelerate Progress Towards Human-like Linguistic Generalization?». Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics: 5210–5217. arXiv:2005.00955Acessível livremente. doi:10.18653/v1/2020.acl-main.465. Consultado em 13 de fevereiro de 2024
  78. ↑ «2024 AI Index – chapter 1» (PDF). 15 de abril de 2024. pp. 37–39. Consultado em 15 de junho de 2024. Cópia arquivada (PDF) em 2 de junho de 2024
  79. ↑ Vipra, Jai; Korinek, Anton (2 de novembro de 2023), Market Concentration Implications of Foundation Models, arXiv:2311.01550Acessível livremente
  80. ↑ «Computational Power and AI». AI Now Institute (em inglês). 27 de setembro de 2023. Consultado em 13 de fevereiro de 2024
  81. ↑ «Exclusive: The $2 Per Hour Workers Who Made ChatGPT Safer». TIME (em inglês). 18 de janeiro de 2023. Consultado em 13 de fevereiro de 2024. Cópia arquivada em 19 de janeiro de 2023
  82. ↑ Liang, Percy; Bommasani, Rishi; Creel, Kathleen (17 de maio de 2022). «The Time is Now to Develop Community Norms for the Release of Foundation Models». Stanford CRFM. Consultado em 13 de fevereiro de 2024. Cópia arquivada em 13 de fevereiro de 2024
  83. ↑ Solaiman, Irene (5 de fevereiro de 2023), The Gradient of Generative AI Release: Methods and Considerations, arXiv:2302.04844Acessível livremente
  84. ↑ Alayrac, Jean-Baptiste (15 de novembro de 2022), Flamingo: a Visual Language Model for Few-Shot Learning, arXiv:2204.14198Acessível livremente