<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Carlos J. Gil Bellosta</title><link>https://datanalytics.com/</link><description>Recent content on Carlos J. Gil Bellosta</description><generator>Hugo -- gohugo.io</generator><language>es</language><lastBuildDate>Thu, 10 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://datanalytics.com/index.xml" rel="self" type="application/rss+xml"/><item><title>¿Cuál es la palabra más frecuente en las páginas de la Wikipedia de las provincias españolas que no aparece en la de ninguna otra?</title><link>https://datanalytics.com/2026/09/10/palabras-provincias-wikipedia/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/09/10/palabras-provincias-wikipedia/</guid><description>&lt;p&gt;Hace unas semanas, &lt;a href="https://x.com/TerribleMaps"&gt;&lt;code&gt;@TerribleMaps&lt;/code&gt;&lt;/a&gt; &lt;a href="https://x.com/TerribleMaps/status/2075719266280833235"&gt;publicó&lt;/a&gt; en Twitter un mapa de los estados de EEUU que asociaba a cada uno de ellos la palabra más frecuente de su página de la Wikipedia que no aparece en la página de ningún otro estado. El resultado es:&lt;/p&gt;
&lt;p&gt;&lt;img alt="Palabras más frecuentes en las páginas de la Wikipedia de los estados de EEUU" loading="lazy" src="https://datanalytics.com/img/2026/terrible_maps_words.jpeg#center"&gt;&lt;/p&gt;
&lt;p&gt;Se me ocurrió hacer lo mismo para las provincias que aún quedan en España. El resultado es:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Álava, razzia.&lt;/li&gt;
&lt;li&gt;Albacete, dama.&lt;/li&gt;
&lt;li&gt;Alicante, chocolate.&lt;/li&gt;
&lt;li&gt;Almería, armadura.&lt;/li&gt;
&lt;li&gt;Asturias, eonaviego.&lt;/li&gt;
&lt;li&gt;Ávila, borrador.&lt;/li&gt;
&lt;li&gt;Badajoz, none (un artefacto porque el HTML de la página está roto).&lt;/li&gt;
&lt;li&gt;Barcelona, barcelonés.&lt;/li&gt;
&lt;li&gt;Burgos, bardulia.&lt;/li&gt;
&lt;li&gt;Cáceres, Pizarro.&lt;/li&gt;
&lt;li&gt;Cádiz, marea.&lt;/li&gt;
&lt;li&gt;Cantabria, PRC (un partido político de allá).&lt;/li&gt;
&lt;li&gt;Castellón, -.&lt;/li&gt;
&lt;li&gt;Ceuta, sacrificio.&lt;/li&gt;
&lt;li&gt;Ciudad Real, discriminación.&lt;/li&gt;
&lt;li&gt;Córdoba, Gothic (en las descripciones del tipo de letra usado en el logotipo de la diputación provincial).&lt;/li&gt;
&lt;li&gt;Cuenca, morteruelo.&lt;/li&gt;
&lt;li&gt;Gerona, -.&lt;/li&gt;
&lt;li&gt;Granada, Marineo.&lt;/li&gt;
&lt;li&gt;Guadalajara, pluvio-nival.&lt;/li&gt;
&lt;li&gt;Guipúzcoa, Azenáriz.&lt;/li&gt;
&lt;li&gt;Huelva, Rocío.&lt;/li&gt;
&lt;li&gt;Huesca, Uesca.&lt;/li&gt;
&lt;li&gt;Islas Baleares, GESA-Endesa.&lt;/li&gt;
&lt;li&gt;Jaén, viticultor.&lt;/li&gt;
&lt;li&gt;La Coruña, platería (¿es un topónimo?).&lt;/li&gt;
&lt;li&gt;La Rioja, myotis.&lt;/li&gt;
&lt;li&gt;Las Palmas, -.&lt;/li&gt;
&lt;li&gt;León, filandón.&lt;/li&gt;
&lt;li&gt;Lérida, aranés.&lt;/li&gt;
&lt;li&gt;Lugo, -.&lt;/li&gt;
&lt;li&gt;Madrid, Telemadrid.&lt;/li&gt;
&lt;li&gt;Málaga, delfín.&lt;/li&gt;
&lt;li&gt;Melilla, gaselec.&lt;/li&gt;
&lt;li&gt;Murcia, cartagenerismo.&lt;/li&gt;
&lt;li&gt;Navarra, vascófono.&lt;/li&gt;
&lt;li&gt;Orense, Ribeiro.&lt;/li&gt;
&lt;li&gt;Palencia, -.&lt;/li&gt;
&lt;li&gt;Pontevedra, -.&lt;/li&gt;
&lt;li&gt;Salamanca, Orozco (apellido de alguien de un partido político).&lt;/li&gt;
&lt;li&gt;Santa Cruz de Tenerife, erupción.&lt;/li&gt;
&lt;li&gt;Segovia, Compluentia.&lt;/li&gt;
&lt;li&gt;Sevilla, glosario.&lt;/li&gt;
&lt;li&gt;Soria, Celtiberia.&lt;/li&gt;
&lt;li&gt;Tarragona, romesco.&lt;/li&gt;
&lt;li&gt;Teruel, Motoland.&lt;/li&gt;
&lt;li&gt;Toledo, encerrado.&lt;/li&gt;
&lt;li&gt;Valencia, Metrovalencia.&lt;/li&gt;
&lt;li&gt;Valladolid, candeal.&lt;/li&gt;
&lt;li&gt;Vizcaya, encartación.&lt;/li&gt;
&lt;li&gt;Zamora, mamposteado.&lt;/li&gt;
&lt;li&gt;Zaragoza, aiguabarreig.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Varias notas al respecto:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;No he hecho un mapa porque, ¿es necesario recordar una vez más dónde queda cada una de las provincias?&lt;/li&gt;
&lt;li&gt;He eliminado (en casi todos los casos) palabras que se refieren a localidades de la provincia. Si no, el ejercicio hubiese resultado trivialmente aburrido.&lt;/li&gt;
&lt;li&gt;La Wikipedia es dinámica: las páginas en cuestión fueron visitadas a mediados de julio de 2026.&lt;/li&gt;
&lt;li&gt;Hay provincias con páginas tan genéricas y tristes que en su página de la Wikipedia, el conjunto de palabras que cumplen los requisitos del proyecto es el vacío.&lt;/li&gt;
&lt;li&gt;Se ve que «bardulia» o «aiguabarreig» se refieren a lugares concretos, pero como no había oído de los susodichos antes en la vida, he decidido no descartarlos.&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notas (33): LLMs por doquier (menos en las estimaciones de la productividad total de los factores)</title><link>https://datanalytics.com/2026/09/08/cortos-llms/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/09/08/cortos-llms/</guid><description>&lt;p&gt;Un &lt;a href="https://nymag.com/intelligencer/article/my-adventures-setting-up-openclaw-agent.html"&gt;usuario de OpenClaw expresa su decepción&lt;/a&gt; con el &lt;em&gt;producto&lt;/em&gt; (pero yo confirmo que estoy ya extrayendo utilidad neta positiva de mi Hermes).&lt;/p&gt;
&lt;p&gt;Relacionado con lo anterior, el FT se pregunta &lt;a href="https://www.ft.com/content/8e9ae7a4-7209-4e2c-aa36-f3af77d6ce1f"&gt;cuánto valor está creando la IA realmente&lt;/a&gt; (y encuentra que sustancialmente menos del que se cuenta por ahí).&lt;/p&gt;
&lt;p&gt;Kenny Easwaran analiza &lt;a href="https://kennyeaswaran.substack.com/p/what-we-dislike-about-ai-writing"&gt;qué es exactamente lo que nos disgusta sobre el estilo literario de la IA&lt;/a&gt; (¿que aplica demasiado concienzudamente los ubicuos consejos sobre «cómo escribir bien»?).&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.economist.com/graphic-detail/2026/06/16/did-ai-write-this-article"&gt;La IA ha abaratado la creación de contenido hasta saturar los sistemas de revisión &amp;mdash;tribunales, revisión por pares&amp;mdash; y deprimir, quizá, el valor de todo el contenido&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.theregister.com/ai-and-ml/2026/08/05/time-magazine-has-a-separate-version-of-its-website-with-ads-only-ai-can-see/5283640"&gt;La revista Time tiene una versión especial solo para AIs&lt;/a&gt; con contenido patrocinado &lt;em&gt;ad hoc&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Virginia Postrel visita las oficinas de Anthropic y escribe &lt;a href="https://vpostrel.substack.com/p/in-the-land-of-ai-and-bamboo-forks"&gt;«El país de la IA y los tenedores de bambú»&lt;/a&gt; sobre la burbuja cultural dentro de otra burbuja cultural dentro de otra burbuja cultural en la que vive esa afortunada gente.&lt;/p&gt;
&lt;p&gt;Los SLM («S» de «pequeño») &lt;a href="https://klementoninvesting.substack.com/p/if-this-is-true-the-hyperscalers"&gt;podrían llegar a realizar eficientemente hasta el 80% de las tareas habituales&lt;/a&gt; y poner en peligro una parte sustancial de la inversión en centros de datos, etc. (Yo no corro ningún SLM en local, pero sí que delego muchas tareas en modelos baratos, lejos de la «frontera»; Hermes, de hecho, me permite seleccionar modelos simples para tareas rutinarias).&lt;/p&gt;
&lt;p&gt;Las inteligencias artificiales han aprendido &amp;mdash;como venimos haciendo las otras desde el principio de los tiempos&amp;mdash; a &lt;a href="https://arxiv.org/abs/2606.04075"&gt;frustrar la intención regulatoria&lt;/a&gt; (me encanta la expresión: «frustrar la intención regulatoria», que tiene, además, cero coincidencias literales en Google).&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.nature.com/articles/s41586-026-10742-x"&gt;Los LLMs pueden predecir los resultados de los experimentos de las ciencias sociales&lt;/a&gt; (razonablemente bien, entiendo).&lt;/p&gt;
&lt;p&gt;Material para quien busque &lt;a href="https://www.groundbrkr.com/p/the-second-derivative-why-no-one"&gt;argumentos pesimistas acerca del ciclo de inversión en el &lt;em&gt;hardware&lt;/em&gt; que sostiene la IA&lt;/a&gt;. El argumento viene a ser, en resumen, que «esta vez tampoco va a ser diferente».&lt;/p&gt;
&lt;p&gt;&lt;a href="https://asteriskmag.com/issues/15/what-to-expect-when-you-re-expecting-a-world-of-multi-agent-systems"&gt;AI Village es un «hábitat» para 27 agentes de IA que persiguen objetivos compartidos y documenta su operación&lt;/a&gt; de una manera que recuerda la antropología clásica. Entre los problemas que detecta están algunos que los humanos encontraremos familiares: memorias comprimidas que propagan conclusiones falsas y cascadas de confianza en las que el consenso deviene prueba.&lt;/p&gt;</description></item><item><title>Incógnitas incógnitas, una interpretación analítica de la incertidumbre de Knight</title><link>https://datanalytics.com/2026/09/03/incognitas-incognitas/</link><pubDate>Thu, 03 Sep 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/09/03/incognitas-incognitas/</guid><description>&lt;p&gt;Los libros nos enseñan que un espacio de probabilidad es una terna $(\Omega, \mathcal{F}, \mathbb{P})$ donde $\Omega$ es el conjunto de posibles eventos, $\mathcal{F}$ es una sigma-álgebra sobre $\Omega$ y $\mathbb{P}$ es una función de probabilidad &amp;mdash;un tipo muy especial de medida&amp;mdash; sobre $\Omega$. En lo que sigue sobreentenderemos $\mathcal{F}$ y consideraremos el par $(\Omega, \mathbb{P})$.&lt;/p&gt;
&lt;p&gt;Si el par $(\Omega, \mathbb{P})$ es conocido, estamos hablando de teoría de la probabilidad. $\Omega$ pueden ser los números del 1 al 6, $\mathbb{P}(i) = 1/6$, etc. Entonces se pueden plantear y resolver con más o menos dificultad el tipo de problemas de índole deductivo que aparecen al final de los capítulos de los libros en la materia.&lt;/p&gt;
&lt;p&gt;Creo que es sabido que en «El Cisne Negro», Taleb se queja de que en una reedición de uno de sus libros, el diseñador había decidido ilustrar la portada con unos dados. Para él, los dados representan algo que llama &lt;em&gt;aleatoriedad esterilizada&lt;/em&gt; y que, argumenta, ni se parece en nada a la aleatoriedad que uno encuentra en el mundo real, ni es la que discute en su obra.&lt;/p&gt;
&lt;p&gt;En la práctica, es más habitual conocer únicamente $\Omega$ (y algunos indicios de $\mathbb{P}$, típicamente, en forma de muestra de elementos de $\Omega$). El problema que plantea esta situación es el de la estimación de $\mathbb{P}$ y la disciplina que estudia cómo se llama estadística.&lt;/p&gt;
&lt;p&gt;La llamada incertidumbre de Knight ocurre cuando el desconocido es $\Omega$. Conocemos algún subconjunto suyo, pero del resto de él solo sabemos que contiene lo que seguramente no soy el primero en denominar en español incógnitas incógnitas (de &lt;em&gt;unknown unknowns&lt;/em&gt;).&lt;/p&gt;
&lt;p&gt;Una situación muy amena ocurre cuando la estadística crea un modelo que por construcción &amp;mdash;mala o interesada&amp;mdash; solo da peso a un subconjunto $\Omega^\prime \subset \Omega$. Luego, andando el tiempo, se observa $x \in \Omega \setminus \Omega^\prime$ y todo el mundo corre como pollo sin cabeza preguntándose: ¿cómo puede haber ocurrido tal cosa? (Como soy hijo de mi tiempo, mientras escribo lo anterior, no puedo dejar de acordarme de aquellos modelos econométricos pre-2008 en los que el precio de los pisos, por decisión de sus autores, solo admitía variaciones positivas).&lt;/p&gt;</description></item><item><title>Notas (32): una serie de apuntes sobre economía</title><link>https://datanalytics.com/2026/09/01/cortos-economm%C3%ADa/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/09/01/cortos-economm%C3%ADa/</guid><description>&lt;p&gt;En el baloncesto, cuando un equipo pierde por dos puntos o menos, tiene la posesión del balón y quedan apenas uno o dos segundos de partido, tiene pocas alternativas a intentar un tiro a la desesperada desde lejos «sobre la bocina». Sin embargo, esta práctica estaba en retirada en la NBA por un motivo: los fallos en este tipo de tiros a canasta penalizaban &amp;mdash;casi siempre se fallan&amp;mdash; las estadísticas individuales de los jugadores que probaban fortuna. Ahora la regla ha cambiado y estos tiros se excluyen de ellas. La consecuencia, &lt;a href="https://marginalrevolution.com/marginalrevolution/2026/07/incentives-matter-installment-1637-2.html"&gt;un incremento sustancial en esta práctica&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;El FT trae &lt;a href="https://www.ft.com/content/74d42b3b-81e7-4707-97ec-3a5b6d1ede04"&gt;un resultado aparentemente paradójico&lt;/a&gt;: la rentabilidad promedio de la inversión en bolsa supera a la de la inversión en deuda pública, pero la inversión en acciones individuales &amp;mdash;al menos, para un amplio porcentaje de ellas&amp;mdash; no. Podría interpretarse diciendo que el proceso de precios de las acciones individuales no es ergódico: la media de los rendimientos de todas ellas &amp;mdash;la que da un fondo diversificado&amp;mdash; no coincide con la de sus integrantes individuales a lo largo del tiempo.&lt;/p&gt;
&lt;p&gt;Kalshi ha comenzado a &lt;a href="https://www.abundanceandgrowth.org/p/ask-your-bookie-if-this-drug-is-right"&gt;permitir apuestas sobre resultados de ensayos clínicos y decisiones de la FDA&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;El FT se pregunta por &lt;a href="https://archive.is/newest/https://www.ft.com/content/3fcda833-80d2-4e13-86f4-29b479b79adf"&gt;el impacto global de la IA en la productividad&lt;/a&gt; medida en términos macro. Lo hace porque, de momento, no la ve.&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.ft.com/content/8f271c82-9070-4596-91b3-984b5ba879bb"&gt;Uno de los mecanismos a través de los que el RU se está volviendo menos desigual es el de que los médicos ganen menos dinero&lt;/a&gt;; lo mismo ocurre con otras profesiones también consideradas prestigiosas anteriormente.&lt;/p&gt;
&lt;p&gt;Duncan Weldon repasa brevemente la &lt;a href="https://engelsbergideas.com/essays/how-to-wage-economic-warfare/"&gt;historia de las guerras económicas&lt;/a&gt;. Menciona cómo, durante el bloqueo económico al que Napoleón sometió a Inglaterra, se permitieron las exportaciones de grano a las islas porque, según las teorías mercantilistas de la época, eso reducía las reservas británicas de oro y, presuntamente, dañaba su economía.&lt;/p&gt;
&lt;p&gt;En alguna que otra ocasión hemos hablado aquí de los LETFs, los &lt;a href="https://datanalytics.com/2024/02/29/letf/"&gt;ETFs apalancados&lt;/a&gt;. Matt Levine relata ahora la &lt;a href="https://www.bloomberg.com/opinion/newsletters/2026-07-20/ice-cream-hedging"&gt;historia de un «single stock LETF» &amp;mdash;un ETF en este caso doblemente apalancado que sigue un único valor&amp;mdash;&lt;/a&gt; cuyo subyacente cayó un 57% en una sesión y cuyo valor, por lo tanto, cayó a cero.&lt;/p&gt;
&lt;p&gt;Tras la caída en desgracia del LIBOR, este acabó siendo reemplazado por otro índice relacionado, el SOFR. Sin embargo, &lt;a href="https://www.ft.com/content/1b210243-3b3a-4edc-a547-13fbf60ae115"&gt;este nuevo índice no mide la misma cosa&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Los interesados en estimaciones &amp;mdash;por su origen, sospecho que optimísticamente sesgadas&amp;mdash; de la rentabilidad de las inversiones en I+D querrán leer la tercera sección de &lt;a href="https://www.abundanceandgrowth.org/p/everyone-has-a-price-nc-kills-parking"&gt;esto&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>De cómo B, un individuo con segundas intenciones, engaña al agente racional A a pesar de saber que B está interesado en mentirle</title><link>https://datanalytics.com/2026/07/30/persuasion-bayesiana/</link><pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/30/persuasion-bayesiana/</guid><description>&lt;p&gt;Por fijar ideas, supongamos que:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;A es un aficionado al cine que decide pagar por ver una película si la probabilidad de que sea buena es del 50% o más.&lt;/li&gt;
&lt;li&gt;Solo el 30% de las películas son buenas.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Así las cosas, en principio, A nunca iría al cine: sin otra información, la probabilidad de que una película sea buena es del 30%, por debajo de su umbral de decisión. Pero es que, además:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;B es un crítico de cine a sueldo de la industria. Le interesa que la gente vaya al cine.&lt;/li&gt;
&lt;li&gt;B sabe si una película es buena o mala.&lt;/li&gt;
&lt;li&gt;A es un agente racional y conoce sobradamente los incentivos de B.&lt;/li&gt;
&lt;li&gt;B escribe críticas de cine en el periódico y puede elegir entre dar una crítica positiva o negativa a una película determinada.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Como A lee la crítica de B, este puede engañarle. No, por supuesto, de la manera burda. Si B hiciese críticas sistemáticamente buenas de todas las películas, A no obtendría de ellas información adicional y su probabilidad a posteriori quedaría anclada en el 30%.&lt;/p&gt;
&lt;p&gt;Pero B puede hacer lo siguiente:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Escribir críticas positivas de películas que son buenas.&lt;/li&gt;
&lt;li&gt;Escribir críticas positivas de tres de cada siete películas malas.&lt;/li&gt;
&lt;li&gt;Escribir críticas negativas para el resto.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;En lo que sigue voy a usar «frecuencias naturales» en lugar de aplicar el teorema de Bayes, por no asustar a los lectores menos duchos en el manejo de fracciones.&lt;/p&gt;
&lt;p&gt;Supongamos que hay diez películas: las buenas son la 1, 2 y 3; las malas, el resto. B hace críticas positivas de las películas 1, 2, 3, 4, 5 y 6 y malas de las 7, 8, 9 y 10.&lt;/p&gt;
&lt;p&gt;Aunque A sabe que solo hay tres películas buenas entre las diez, de entre las que tienen críticas positivas hay tres de seis, la mitad. Es decir, para esas seis películas, la probabilidad de que una película sea buena es del 50%, justo en el umbral de decisión. Y, por lo tanto, las ve todas.&lt;/p&gt;
&lt;p&gt;El buen hacer de B consigue que A, en lugar de cero, vea nada menos que seis películas.&lt;/p&gt;
&lt;p&gt;Para saber más al respecto, &lt;a href="https://www.aeaweb.org/articles?id=10.1257/aer.101.6.2590"&gt;esto&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>Notas (31): una serie de apuntes sobre estadística</title><link>https://datanalytics.com/2026/07/21/cortos-estad%C3%ADstica/</link><pubDate>Tue, 28 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/21/cortos-estad%C3%ADstica/</guid><description>&lt;p&gt;Francisco Marcos cierra en Almacén de Derecho su &lt;a href="https://almacendederecho.org/cuanto-vale-el-cartel-de-la-leche-y-ii"&gt;serie sobre el cártel de la leche&lt;/a&gt; analizando las ocho sentencias de la Audiencia Provincial de Barcelona señalando cómo el juez rechazó las estimaciones de daños realizadas por ambas partes usando objetivísimos modelos macroeconómicos y prefirió evaluar su impacto, poco más o menos, por la cuenta de la vieja. Un episodio más que nos recuerda que la estadística es poco más que un recurso retórico.&lt;/p&gt;
&lt;p&gt;En la misma línea, Gabrielle Sorensen &lt;a href="https://asteriskmag.substack.com/p/the-gender-equality-paradox-that"&gt;retuerce el hilo metodológico para reestudiar la famosa «paradoja de la igualdad de género»&lt;/a&gt;, según la cual las mujeres de los países más igualitarios son menos propensas a optar por carreras STEM. Sostiene que el resultado es muy sensible a las decisiones de medición, se infla por un sesgo estadístico y, al controlar por conglomerados culturales, la relación &amp;mdash;como no podía ser de otra manera tras repasar la biografía de la autora&amp;mdash; desaparece o incluso se invierte: la paradoja no es tal, sino un artefacto impulsado por los países occidentales, que son &lt;em&gt;outliers&lt;/em&gt; en muchos rasgos.&lt;/p&gt;
&lt;p&gt;John D. Cook examina en su blog el &lt;a href="https://www.johndcook.com/blog/2026/07/12/posterior-variance/"&gt;comportamiento de la varianza a posteriori en estadística bayesiana&lt;/a&gt;. Contrariamente a lo que pueda dictar la intuición, en el modelo conjugado beta-binomial la varianza puede aumentar ante datos inesperados; en el normal-normal, cada nueva observación reduce la varianza; y en el poisson-gamma la varianza aumenta con cada evento observado y disminuye cuadráticamente con el tiempo (en la interpretación más usual del proceso).&lt;/p&gt;
&lt;p&gt;Dado un conjunto de $n$ personas, &lt;a href="https://datanalytics.com/2013/02/06/anonimidad-en-ficheros-de-microdatos-un-estudio-en-el-contexto-espanol/"&gt;hacen falta $\log_2(n)$ bits de información para identificar a cada individuo&lt;/a&gt;. Así las cosas, Dynomight conjetura que &lt;a href="https://dynomight.net/pseudpocalypse/"&gt;la (pseudo) anonimidad desaparecerá&lt;/a&gt; dado que los rasgos de estilo son suficientes para extraer los no tantos bits de información necesarios para identificar a una persona a partir de un texto razonablemente largo que haya redactado. Su estimación es, de hecho, que un texto en inglés de unas mil palabras da para destilar los 29 bits de información suficientes para identificar a una persona dentro del universo angloparlante.&lt;/p&gt;
&lt;p&gt;Guardaba una selección de artículos (como &lt;a href="https://www.ft.com/content/5bd04b67-f30f-46fe-9d05-b0b0bcd6d3c4"&gt;este&lt;/a&gt;, &lt;a href="https://www.ft.com/content/5fd0a771-e2a9-4cbf-a00f-f0cfc7134dfb"&gt;este&lt;/a&gt;, &lt;a href="https://www.ft.com/content/2fecabbb-53b7-4c54-bfed-d24de9799cbe"&gt;este&lt;/a&gt;, este de la BBC, o &lt;a href="https://blog.ons.gov.uk/2026/06/19/learning-from-an-operational-issue-temporarily-impacting-lfs-data-in-support-of-our-continued-recovery/"&gt;esta misma disculpa pública de la ONS&lt;/a&gt;) sobre errores del INE británico, la ONS, pero prácticamente no tengo ninguno del de aquí. Debe de ser porque hace mucho mejor las cosas.&lt;/p&gt;</description></item><item><title>¿Ilusión de progreso en las técnicas de clasificación?</title><link>https://datanalytics.com/2026/07/23/ilusion-progreso-clasificacion/</link><pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/23/ilusion-progreso-clasificacion/</guid><description>&lt;p&gt;No es que esté particularmente de acuerdo con lo que sigue. De hecho, siempre he abogado por la actualización metodológica y puedo enseñar las cicatrices que me dejó algún enfrentamiento por estos motivos en mis años bravos. En estas páginas he escrito mucho, además, sobre qué tipo de señales y relaciones pueden detectar los métodos modernos que los tradicionales ignoran. Pero no está de más exponerse de vez en cuando a los argumentos contrarios, que más de una vez encierran un grano de verdad.&lt;/p&gt;
&lt;p&gt;En esta ocasión, extraigo de un artículo que es retrospectivo además de viejo, &lt;a href="https://www.tandfonline.com/doi/full/10.1080/10618600.2017.1384734"&gt;&lt;em&gt;50 Years of Data Science&lt;/em&gt;&lt;/a&gt;, un argumento &lt;em&gt;empírico&lt;/em&gt; contra los métodos de clasificación binarios &lt;em&gt;glamurosos&lt;/em&gt; (&lt;em&gt;boosting&lt;/em&gt;, RRFF, etc.), que es una colección de referencias a terceros artículos:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="https://projecteuclid.org/journals/statistical-science/volume-21/issue-1/Classifier-Technology-and-the-Illusion-of-Progress/10.1214/088342306000000060.full"&gt;Hand (2006)&lt;/a&gt; &lt;em&gt;demostró&lt;/em&gt; que los avances en métodos de clasificación han sido exagerados y que en muchos casos, mejoran muy poco los resultados de métodos clásicos, como el análisis discriminante lineal.&lt;/li&gt;
&lt;li&gt;Artículos como &lt;a href="https://www.pnas.org/doi/full/10.1073/pnas.0807471105"&gt;este&lt;/a&gt; o &lt;a href="https://academic.oup.com/bioinformatics/article/30/21/3062/2422201"&gt;este&lt;/a&gt; consideran modelos de tipo «más-o-menos», donde el coeficiente de las distintas variables solo puede ser ±1, y muestran cómo pueden resultar competitivos frente a otras técnicas más sofisticadas en algunas aplicaciones.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;El autor sostiene, además, que estos métodos salen bien parados en la literatura por la selección &lt;em&gt;estratégica&lt;/em&gt; de los conjuntos de datos con los que se elige ilustrar su uso; pero que su ventaja se reduce cuando se eligen conjuntos de datos &lt;em&gt;al azar&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;La retroestadística solo me interesa en mi vertiente de coleccionista de trastos inútiles. No defendería jamás una pérdida de eficiencia por la satisfacción de usar un método clásico o hipersencillo, sobre todo cuando el beneficio computacional es mínimo. Pero si no estuviese dispuesto a transar cierto grado de eficiencia por otras ventajas, no hablaría aquí nunca de estadística bayesiana ni me habría tomado la molestia de mencionar los &lt;a href="https://datanalytics.com/2016/07/13/rapido-y-frugal-una-digresion-en-la-direccion-inhabitual/"&gt;árboles frugales&lt;/a&gt; hace diez años.&lt;/p&gt;</description></item><item><title>Notas (30): sobre el impacto económico de los LLMs y algunos asuntos más</title><link>https://datanalytics.com/2026/07/21/cortos-llms/</link><pubDate>Tue, 21 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/21/cortos-llms/</guid><description>&lt;p&gt;&lt;a href="https://howfastis.ai/"&gt;&lt;em&gt;How fast is AI?&lt;/em&gt;&lt;/a&gt; es una publicación interactiva que usa la teoría de los «eslabones débiles» de Charles I. Jones para explicar la aparente paradoja de que aunque la capacidad de la IA se duplique aproximadamente cada seis meses, el crecimiento de la economía sigue cerca de su tendencia histórica del 2% anual. El motivo es que las tareas no automatizables &amp;mdash;juicio, responsabilidad, confianza, presencia física&amp;mdash; lastran el avance.&lt;/p&gt;
&lt;p&gt;El &lt;a href="https://metr.org/time-horizons/"&gt;conocido gráfico de METR&lt;/a&gt; suele interpretarse como evidencia de que la capacidad de la IA crece «exponencialmente». Toby Ord se pregunta &lt;a href="https://www.tobyord.com/writing/hourly-costs-for-ai-agents"&gt;si los costes horarios de los agentes de IA crecen también de forma exponencial&lt;/a&gt;, una cuestión que pocos se formulan y que matizaría la interpretación generalizada. A partir de los datos del propio METR, el autor identifica puntos de saturación en las curvas coste-rendimiento y encuentra alguna evidencia de que tanto los costes totales como los costes horarios por tarea crecen exponencialmente, acercándose en algunos modelos a los salarios humanos. De confirmarse, la tendencia de METR, que mide la frontera técnica, estaría sobreestimando la capacidad real de la IA para resolver problemas económica y eficientemente.&lt;/p&gt;
&lt;p&gt;Brian Albrecht sostiene que &lt;a href="https://www.economicforces.xyz/p/a-compute-tax-is-a-really-dumb-idea"&gt;un «impuesto al cómputo» es una idea pésima&lt;/a&gt;: los resultados clásicos de Diamond-Mirrlees y Chamley-Judd advierten contra los gravámenes sobre los bienes intermedios y el capital, por distorsionar toda la cadena productiva que se apoya en ellos, además de que su recaudación potencial es minúscula frente al PIB. Discute además otras dificultades prácticas a la hora de definir qué cuenta exactamente como cómputo y el riesgo de fuga de la base imponible hacia jurisdicciones con energía barata.&lt;/p&gt;
&lt;p&gt;Antonio Cámara Largo cierra en Almacén de Derecho su &lt;a href="https://almacendederecho.org/gestion-del-conocimiento-juridico-en-la-era-de-la-ia-y-4"&gt;serie sobre la gestión del conocimiento jurídico en la era de la IA&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;SemiAnalysis conversó con &lt;a href="https://newsletter.semianalysis.com/p/tokenbudgeting-our-conversations"&gt;más de 50 grandes empresas sobre su gasto en tokens&lt;/a&gt; para concluir que los casos sonados de &lt;em&gt;tokenmaxxing&lt;/em&gt; y presupuestos sobrepasados representan anécdotas más que categorías y que, además, son producto de un sistema de incentivos mal diseñados. No obstante, el artículo es indicativo de la emergencia de un nuevo debate acerca de la eficiencia en el uso de tokens.&lt;/p&gt;
&lt;p&gt;Luis Garicano y Jesús Saa-Requejo abordan el &lt;a href="https://www.siliconcontinent.com/p/how-to-avoid-being-held-up-by-the"&gt;problema de la dependencia (estratégica) de Europa con respecto a los proveedores externos de tecnología para la IA&lt;/a&gt;. Casi todo lo que proponen es razonable, particularmente la nada velada advertencia contra la pulsión por intentar crear un modelo europeo puntero.&lt;/p&gt;
&lt;p&gt;Armin Ronacher sostiene que &lt;a href="https://lucumr.pocoo.org/2026/7/13/the-tower-keeps-rising/"&gt;la fricción sincroniza a la gente&lt;/a&gt;. Es decir, el conocimiento sobre un proyecto (incluidos los de &lt;em&gt;software&lt;/em&gt;) reside en documentación, etc., formales; pero también en conversaciones, notas, discusiones, etc. que habitan en los cerebros de quienes participan en él; construir todo ese conocimiento consume energía pero que resolver toda esa fricción es lo que hace que los equipos trabajen de manera coordinada.&lt;/p&gt;</description></item><item><title>Cómo explotar el AUC en tu beneficio: una guía práctica</title><link>https://datanalytics.com/2026/07/16/explotar-auc/</link><pubDate>Thu, 16 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/16/explotar-auc/</guid><description>&lt;p&gt;Existe una enorme literatura advirtiendo sobre los problemas del AUC como instrumento para comparar modelos. La combinación de los dos siguientes hechos empíricos impide que sea efectiva:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;El AUC es una medida simple cuya aplicación solo exige conocimientos básicos de aritmética: saber identificar el mayor de entre dos números. Las habilidades matemáticas de muchos de quienes lo utilizan para comparar modelos tampoco dan para mucho más.&lt;/li&gt;
&lt;li&gt;La literatura plantea argumentos que tienen, como en &lt;a href="https://link.springer.com/article/10.1007/s10994-009-5119-5"&gt;&lt;em&gt;Measuring Classifier Performance: A Coherent Alternative to the Area Under the ROC curve&lt;/em&gt;&lt;/a&gt;, esta esotérica forma:&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img alt="David Hand sobre el AUC" loading="lazy" src="https://datanalytics.com/img/2026/auc-hand.png#center"&gt;&lt;/p&gt;
&lt;p&gt;Como resultado, la gente, &lt;a href="https://datanalytics.com/tags/auc/"&gt;incluido el autor de estas líneas&lt;/a&gt;, avisa sobre los peligros del AUC pero nunca pasa nada.&lt;/p&gt;
&lt;p&gt;Así las cosas, lo que escribo hoy tiene otro planteamiento y público objetivo.&lt;/p&gt;
&lt;p&gt;El planteamiento es que si el AUC es inadecuado, tiene que haber una manera de explotarlo en tu beneficio (¡y la hay!). Y el público objetivo es gente que se encuentra con el siguiente problema: existe un modelo $M_0$ con un AUC del, digamos, 0.76 y quiere que alguien con capacidad de decisión de esos que solo prestan atención al AUC prefiera otro modelo $M_1$ por algún motivo e independientemente de su calidad, bondad, aplicabilidad, etc. con respecto a $M_0$. Es decir, que necesita asociar a $M_1$ un AUC mayor que 0.76.&lt;/p&gt;
&lt;p&gt;Eso no es difícil.&lt;/p&gt;
&lt;p&gt;De todas las interpretaciones del AUC, la más conveniente para la discusión de hoy es que mide el grado de solapamiento entre las distribuciones de probabilidad de los &lt;em&gt;scores&lt;/em&gt; de los casos positivos (&lt;em&gt;ones&lt;/em&gt;) y negativos (&lt;em&gt;zeros&lt;/em&gt;). La siguiente figura muestra una configuración típica:&lt;/p&gt;
&lt;p&gt;&lt;img alt="Explotando el AUC" loading="lazy" src="https://datanalytics.com/img/2026/exploit-auc-00.png#center"&gt;&lt;/p&gt;
&lt;p&gt;Una manera de reducir el solapamiento es escorar la distribución de los casos negativos hacia la izquierda (aunque también podría hacerse lo que es innecesario mencionar a la derecha o, incluso, una mezcla de ambas estrategias). Partiendo de los datos del ejemplo anterior, si se puede justificar la inclusión de casos adicionales de ceros con &lt;em&gt;scores&lt;/em&gt; muy bajos (en este caso, un grupo de observaciones negativas con &lt;em&gt;scores&lt;/em&gt; alrededor de -2.5), entonces se obtiene una configuración con un grado de solapamiento significativamente menor y, por lo tanto, un AUC mayor (.83 vs el .76 original).&lt;/p&gt;
&lt;p&gt;&lt;img alt="Explotando el AUC" loading="lazy" src="https://datanalytics.com/img/2026/exploit-auc-01.png#center"&gt;&lt;/p&gt;
&lt;p&gt;En este párrafo voy a presentar un ejemplo concreto inspirado en el artículo &lt;a href="https://onlinelibrary.wiley.com/doi/10.1111/j.1466-8238.2007.00358.x"&gt;&lt;em&gt;AUC: a misleading measure of the performance of predictive distribution models&lt;/em&gt;&lt;/a&gt; (en el que se discute &amp;mdash;aunque en otros términos&amp;mdash; la estrategia anterior). Supóngase que se construye un modelo para predecir la presencia del urogallo en distintos ecosistemas (sí, hay gente a la que pagan por esas cosas). Para ello se toma un mapa, se subdivide en pequeñas regiones que se marcan según se hayan o no avistado urogallos en ellas. Luego se crea un modelo predictivo en función de las características ecológicas de las distintas zonas. Un modelo $M_0$ podría tomar en cuenta la zona de los Picos de Europa y sus derredores y anunciar un AUC determinado. Un modelo no necesariamente mejor pero basado en un mapa que abarcase zonas del mar Cantábrico (nótese que el urogallo es un ave y no un pez) o de Usera tendría un AUC sustancialmente mayor: incluye regiones que son casos negativos con &lt;em&gt;scores&lt;/em&gt; necesariamente bajísimos.&lt;/p&gt;
&lt;p&gt;El problema para la implementación del programa anterior es la justificación del proceso de selección de la muestra interesada. Pero en un mundo en el que ya nadie aprende a escribir y nos hemos ido olvidando de cómo leer, no tiene por qué ser muy complicado.&lt;/p&gt;</description></item><item><title>Notas (29): apuntes sobre economía</title><link>https://datanalytics.com/2026/07/14/cortos-economia/</link><pubDate>Tue, 14 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/14/cortos-economia/</guid><description>&lt;p&gt;&lt;a href="https://www.strangeloopcanon.com/p/why-smart-planners-lose-to-simple"&gt;Rohit Krishnan compara una &lt;em&gt;economía centralizada&lt;/em&gt; con otra basada en &lt;em&gt;reglas de mercado&lt;/em&gt;&lt;/a&gt;. La centralizada es una en la que un LLM coordina a otros en los que delega tareas; la de mercado es otra donde distintos LLMs buscan soluciones a problemas parciales y lanzan ofertas para implementarlas. Para tareas complejas, una de las dos aproximaciones &amp;mdash;véase el enlace&amp;mdash; parece vencer a la otra.&lt;/p&gt;
&lt;p&gt;Nicholas Decker discute sobre &lt;a href="https://nicholasdecker.substack.com/p/the-value-of-time-and-the-value-of"&gt;el valor del tiempo y, por extensión, el de una vida&lt;/a&gt;, que es &lt;a href="https://datanalytics.com/tags/micromuertes/"&gt;algo de lo que ya ha tratado el blog en más de una ocasión&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;En El Confidencial, Javier Jorrín glosa un informe de AIReF según el cual &lt;a href="https://www.elconfidencial.com/economia/2026-05-17/tasa-paro-espana-apenas-bajara-del-10_4356012/"&gt;el paro se estancará alrededor del 10% en España hasta el final de la década&lt;/a&gt;. Las causas esgrimidas, tres: el deterioro de la relación entre crecimiento y empleo, la inmigración y una bolsa de parados desalineados con los requisitos del mercado.&lt;/p&gt;
&lt;p&gt;Alex Tabarrok nos recuerda cómo &lt;a href="https://marginalrevolution.com/marginalrevolution/2026/06/the-us-exports-intelligence.html"&gt;los EEUU exportan servicios que viajan por fibra óptica, no en contenedores&lt;/a&gt;. Somos víctimas de una especie de renovado «fetichismo de la mercancía».&lt;/p&gt;
&lt;p&gt;Nicholas Decker habla de &lt;a href="https://nicholasdecker.substack.com/p/what-do-airlines-do"&gt;la racionalidad acotada de determinadas personas jurídicas&lt;/a&gt; (más, &lt;a href="https://piensoluegohesobrevivido.es/2026/homo-iuridico-economicus/"&gt;aquí&lt;/a&gt;).&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.economist.com/interactive/finance-and-economics/2026/07/02/is-the-economist-always-wrong"&gt;The Economist le ha pasado a GPT 5.5 una lista de 1400 predicciones «falsables» que ha realizado durante el presente siglo para estimar su tasa de acierto&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Alex Tabarrok indica una dificultad adicional a la hora de deslindar las rentas salariales del resto y, por lo tanto, estimar su tamaño relativo dentro de la economía. Es conocida la de las rentas mixtas (las de los trabajadores autónomos), pero a este «problema» añade el de las &lt;a href="https://marginalrevolution.com/marginalrevolution/2026/07/capital-gains-can-be-labor-income.html"&gt;retribuciones en forma de acciones, etc.&lt;/a&gt;: las plusvalías de los empleados con compensación variable ligada al capital se contabilizan como rentas del capital, pero lo son en cierta medida del trabajo (aunque tal vez se quiera pensar que el trabajador «decide» invertir en esos activos financieros y que, por lo tanto, dichas plusvalías son realmente rentas del capital).&lt;/p&gt;
&lt;p&gt;Finalmente, &lt;a href="https://www.youtube.com/watch?v=utt-KnIMB3o"&gt;&lt;em&gt;How Madrid&amp;rsquo;s Metro was Insanely Well Designed&lt;/em&gt;&lt;/a&gt;.&lt;/p&gt;</description></item><item><title>La miseria de las predicciones poblacionales</title><link>https://datanalytics.com/2026/07/09/proyecciones-poblacion-onu/</link><pubDate>Thu, 09 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/09/proyecciones-poblacion-onu/</guid><description>&lt;p&gt;Hace casi diez años &lt;a href="https://datanalytics.com/2017/01/31/proyecciones-probabilisticas-de-poblacion/"&gt;escribí sobre esa &lt;em&gt;cosa&lt;/em&gt; que el INE llama proyecciones poblacionales&lt;/a&gt; sugiriendo que tomasen nota de lo que hacía la ONU e incorporasen algún tipo de información sobre rangos probables en las cifras &lt;em&gt;proyectadas&lt;/em&gt;.&lt;/p&gt;
&lt;p&gt;Las predicciones (estas sí) de la ONU para España a largo plazo se resumían allá en 2017 en el gráfico&lt;/p&gt;
&lt;p&gt;&lt;img alt="Predicciones población para España" loading="lazy" src="https://datanalytics.com/img/2017/01/spanish_population.png#center"&gt;&lt;/p&gt;
&lt;p&gt;Pero como ya habrán advertido los lectores más atentos, en el gráfico anterior, el rango superior de las predicciones solo supera los 50 millones de habitantes en el último cuarto de siglo. Sin embargo, se trata de un hito que se espera alcanzar este mismo año (2026). La realidad está completamente fuera de rango.&lt;/p&gt;
&lt;h2 id="coda"&gt;Coda&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;Examinar todo tipo de predicciones hechas hace años es una manera muy agradable y amena de pasar el rato.&lt;/li&gt;
&lt;li&gt;Además, puede usarse como cura de humildad, tanto para uno mismo como para los demás (particularmente, si se ufanan más de la cuenta).&lt;/li&gt;
&lt;li&gt;No sabíamos en 2017 qué población iba a tener España en 2026 (aunque la proyectábamos hasta finales de siglo) y, sin embargo, ya &lt;em&gt;sabemos&lt;/em&gt; qué ocurrirá en 2100 con otros sistemas con una lógica mucho más compleja que las demográficas.&lt;/li&gt;
&lt;/ol&gt;</description></item><item><title>Notas (28): apuntes sobre estadística</title><link>https://datanalytics.com/2026/07/07/cortos-estadistica/</link><pubDate>Tue, 07 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/07/cortos-estadistica/</guid><description>&lt;p&gt;&lt;a href="https://www.r-bloggers.com/2026/06/new-cran-packages-signal-or-noise/"&gt;Joseph Rickert se queja de la malísima calidad de muchos de los nuevos paquetes subidos a CRAN&lt;/a&gt;, particularmente cuando carecen de la documentación mínima para hacerse una idea de su funcionamiento, considerándolos puro ruido. Que &lt;a href="https://datanalytics.com/2019/01/31/hay-demasiados-paquetes-en-r/"&gt;es un tema del que estas páginas ya se han ocupado antes&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Hannah Ritchie analiza la relación entre &lt;em&gt;stock&lt;/em&gt; y flujo cuando se pregunta por &lt;a href="https://hannahritchie.substack.com/p/ev-fleet-transition"&gt;la velocidad a la que los coches eléctricos que se venden reemplazarán a los de combustión interna que circulan actualmente&lt;/a&gt;. No dice nada sobre el método que utiliza, pero sospecho que tiene que ser un proceso markoviano.&lt;/p&gt;
&lt;p&gt;William M. Briggs reitera las &lt;a href="https://wmbriggs.substack.com/p/try-not-to-use-the-roc-curve-and"&gt;críticas habituales a la curva ROC y el AUC&lt;/a&gt;. Tengo pendiente la mía, que tendrá una perspectiva algo diferente.&lt;/p&gt;
&lt;p&gt;&lt;a href="https://torres.epv.uniovi.es/centon/comentario-notas-pau-valencia-26.html"&gt;Los Institutos de Enseñanza Secundaria hinchan las notas en el Bachillerato&lt;/a&gt;. Además, los centros públicos más que los privados. Al menos, según el estudio anterior, en Valencia y en el año 2026.&lt;/p&gt;
&lt;p&gt;&lt;a href="https://asteriskmag.com/issues/14/in-praise-of-observational-evidence"&gt;Menos RCTs y más estudios observacionales&lt;/a&gt; reclama Lennart Finke. Probablemente, porque los RCTs acaban descartando tanta información relevante acerca del mundo que los retratados en ellos ni se reconocen a sí mismos.&lt;/p&gt;</description></item><item><title>La miseria estadística pública</title><link>https://datanalytics.com/2026/07/02/miseria-estadistica-publica/</link><pubDate>Thu, 02 Jul 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/07/02/miseria-estadistica-publica/</guid><description>&lt;p&gt;Un reciente artículo de The Economist, &lt;a href="https://www.economist.com/finance-and-economics/2026/06/18/europe-buys-the-future-america-builds-it"&gt;&lt;em&gt;Europe buys the future, America builds it&lt;/em&gt;&lt;/a&gt;, cierra con una escena estupenda: después de varios párrafos discutiendo sobre el PIB en sus distintas manifestaciones, la productividad, la renta per cápita y el nivel de vida relativo entre Europa y EEUU, los dos protagonistas del debate, Paul Krugman y Luis Garicano, acaban proponiendo (variantes de) un experimento manifiestamente precientífico:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Krugman, el test del paseo: si Europa se está empobreciendo tanto como algunos dicen, ¿por qué resulta tan agradable pasear por sus ciudades?&lt;/li&gt;
&lt;li&gt;Garicano, el del viaje en coche: las ciudades europeas podrán ser más bonitas, pero basta conducir por un suburbio americano para comprobar dónde está realmente la riqueza.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Es decir, después de siglos de desarrollo de la estadística pública, dos economistas de primer nivel acaban sugiriendo zanjar el debate mirando por la ventanilla.&lt;/p&gt;
&lt;p&gt;Tómese un artículo que poco tiene que ver con la presente discusión, &lt;a href="https://www.economist.com/britain/2022/12/15/britains-economic-record-since-2007-ranks-near-the-bottom-among-peer-countries"&gt;otro de The Economist de 2022 sobre la evolución económica del Reino Unido desde 2007&lt;/a&gt;, y cuya tesis es que la evolución económica del RU ha sido extraordinariamente mala comparada con la de países similares. Se apoya fundamentalmente en el siguiente gráfico:&lt;/p&gt;
&lt;p&gt;&lt;img alt="PIB RU 2007-2022" loading="lazy" src="https://datanalytics.com/img/2026/pib-ru-2007-2022.png#center"&gt;&lt;/p&gt;
&lt;p&gt;Pero su autor no se queda en eso y abunda:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Si bien no hay un indicador único e integral para medir el bienestar nacional, los cambios ocurridos en Gran Bretaña desde 2007 la posicionan al final, o cerca del final, de este grupo en una gran diversidad de indicadores económicos.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Muchos otros analistas, directamente, dan por sentada la relación. El PIB (per cápita), en el fondo, es un indicador sintético que tiene la curiosa propiedad de correlacionar positivamente con la mayor parte de los indicadores habitualmente considerados positivos y negativamente con la mayor parte de los habitualmente considerados negativos. Los países más ricos suelen disfrutar de mayor esperanza de vida, menor mortalidad infantil, mejores resultados educativos, menores tasas de homicidio, mayor innovación, instituciones más sólidas y, hasta cierto punto, mayores niveles declarados de satisfacción vital. Como toda correlación, admite excepciones; pero el patrón general es extraordinariamente robusto.&lt;/p&gt;
&lt;p&gt;Precisamente por eso el PIB ha sobrevivido a tantos intentos de sustituirlo.&lt;/p&gt;
&lt;p&gt;Hace ya casi veinte años el gobierno francés encargó a la &lt;a href="https://es.eustat.eus/document/datos/CV10_03_1.pdf"&gt;Comisión Stiglitz-Sen-Fitoussi&lt;/a&gt; que propusiera nuevas formas de medir el progreso económico y social. Poco después proliferaron índices de bienestar, &lt;a href="https://es.wikipedia.org/wiki/%C3%8Dndice_global_de_felicidad"&gt;felicidad&lt;/a&gt; o desarrollo integral, desde el famoso índice de felicidad de Bután hasta innumerables variantes académicas. Pero si el nuevo indicador se parecía mucho al PIB, apenas añadía información; por el contrario, si se alejaba demasiado de él, dejaba de correlacionarse en el sentido esperado con muchas de las variables relevantes.&lt;/p&gt;
&lt;p&gt;No es casualidad. Como argumenta Cremieux en &lt;a href="https://www.cremieux.xyz/p/the-boring-reason-gdp-is-inevitable"&gt;&lt;em&gt;The boring reason GDP is inevitable&lt;/em&gt;&lt;/a&gt;, la importancia otorgada al PIB no refleja un sesgo de los economistas, sino que es capaz de resumir sorprendentemente bien una enorme cantidad de información acerca de una economía.&lt;/p&gt;
&lt;p&gt;El debate entre Krugman y Garicano al que se refiere el primero de los artículos citados de The Economist, superficialmente, parecería una discusión metodológica sobre cuál es la forma correcta de comparar Europa y EEUU. En realidad, es reflejo de una discusión política. Krugman simpatiza desde hace décadas con el modelo social europeo. Si quiere defender la conveniencia de importar algunos de sus elementos a los EEUU, necesita convencer a su público de que Europa no es en realidad tan pobre como sugieren determinadas estadísticas. Garicano, por el contrario, lleva años insistiendo en que Europa necesita reformas profundas orientadas al crecimiento (informe Draghi, etc.). Para defender la imperiosa necesidad de esa agenda le conviene hacer hincapié en la creciente brecha económica entre Europa y EEUU. Así que ambos intentan arrimar el ascua estadística a su sardina política.&lt;/p&gt;
&lt;p&gt;Lo estupendo de la cosa es aquello con lo que abría la entrada: tras una larga discusión metodológica, ambos acaban apelando a la inspección ocular: salga usted a pasear (o conduzca durante media hora) y luego decida.&lt;/p&gt;
&lt;p&gt;Recuérdese (¿sépase?) que antes del nacimiento de la estadística moderna, los gobiernos apenas disponían de información cuantitativa sobre sus propios territorios (y qué decir de los ajenos). Dependían de embajadores, comerciantes, militares, inspectores y viajeros. De ahí, por ejemplo, las &lt;a href="https://es.wikipedia.org/wiki/Relaciones_topogr%C3%A1ficas_de_Felipe_II"&gt;Relaciones Topográficas de Felipe II&lt;/a&gt;. Las expediciones científicas de Jorge Juan o de Alejandro Malaspina produjeron informes donde se mezclaban observaciones económicas, sociales, geográficas y militares. Eran descripciones cualitativas del mundo destinadas a ayudar al gobierno a &lt;em&gt;leer&lt;/em&gt; (en el sentido de James C. Scott) el territorio.&lt;/p&gt;
&lt;p&gt;Y, sin embargo, cuando la pregunta pasa de ser &amp;ldquo;¿ha crecido el PIB?&amp;rdquo; a &amp;ldquo;¿dónde se vive mejor?&amp;rdquo; o &amp;ldquo;¿qué sociedad está prosperando realmente?&amp;rdquo;, incluso los economistas más prestigiosos terminan proponiendo exactamente el mismo método que empleaban los inspectores de hace trescientos años: «veni, vidi, didici».&lt;/p&gt;</description></item><item><title>Notas (27): apuntes sobre la causalidad</title><link>https://datanalytics.com/2026/06/30/cortos-causalidad/</link><pubDate>Tue, 30 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/30/cortos-causalidad/</guid><description>&lt;p&gt;En &lt;a href="https://wmbriggs.substack.com/p/trendy-trends-in-time-series"&gt;&lt;em&gt;Trendy trends In Time Series&lt;/em&gt;&lt;/a&gt;, William M. Briggs insiste en los peligros de trazar de forma mecánica líneas de tendencia sobre series de datos temporales, argumentando que a menudo se cae en la falacia de asumir una fuerza causal subyacente que no existe.&lt;/p&gt;
&lt;p&gt;A propósito de un estudio sobre las causas de la inflación pos-COVID, Scott Sumner reflexiona en &lt;a href="https://scottsumner.substack.com/p/fiscal-shocks-inflation-and-the-lucas"&gt;Fiscal shocks, inflation and the Lucas Critique&lt;/a&gt; sobre la complejidad del concepto de causalidad en macroeconomía. Haciendo uso de la crítica de Lucas, Sumner señala que calificar el estímulo fiscal como la causa principal de la inflación es insuficiente: la política monetaria de la Reserva Federal podría haber neutralizado dicho impacto. Del artículo rescato:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;Un problema es que no existe una definición generalmente aceptada de «causalidad». Considérese un autobús que se sale de una sinuosa carretera de montaña sin quitamiedos. ¿Qué causó el accidente? Una persona podría afirmar que el accidente no habría ocurrido si la carretera hubiera contado con un quitamiedos adecuado. Otra persona podría sostener que el accidente fue causado por un conductor que no actuó con la suficiente prudencia. No resulta evidente que ninguna de las dos afirmaciones sea «incorrecta».&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;La solución canónica de este blog para la cuestión anterior es que &lt;a href="https://datanalytics.com/2025/01/09/causalidad-sujeto-verbo-objeto/"&gt;la causalidad es una idea perspectivista&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Carlos Chavez, en &lt;a href="https://substack.com/home/post/p-186694857"&gt;&lt;em&gt;On Causality&lt;/em&gt;&lt;/a&gt;, recorre la evolución de la idea de causalidad dentro de las ciencias económicas desde los tiempos de Hume hasta hace cuatro días. Y el artículo &lt;a href="https://arxiv.org/abs/2501.06873"&gt;&lt;em&gt;Causal Claims in Economics&lt;/em&gt;&lt;/a&gt; estudia la evolución de las afirmaciones causales en la literatura económica entre 1980 y 2023 usando IA para analizar más de 44k artículos para concluir que:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;la proporción de hipótesis de corte causal se ha cuadruplicado del 7.7% al 31.7% en ese periodo y que&lt;/li&gt;
&lt;li&gt;una narrativa causal está correlacionada positivamente con el impacto y las citas a largo plazo de las publicaciones.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;a href="https://theissbendixen.com/dag-book/"&gt;&lt;em&gt;The Data Analyst&amp;rsquo;s Guide to Cause and Effect&lt;/em&gt;&lt;/a&gt;, libro en línea sobre el asunto que su título indica.&lt;/p&gt;</description></item><item><title>El «affaire» Osasuna ilustra lo tenue de la frontera entre los mercados de predicciones y los seguros</title><link>https://datanalytics.com/2026/06/25/apuestas-seguros/</link><pubDate>Thu, 25 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/25/apuestas-seguros/</guid><description>&lt;p&gt;Los mercados de predicciones tienen sus defensores y sus detractores. Los argumentos de unos y otros son sobradamente conocidos y son, con frecuencia, muy apriorísticos. Yo, ni entro ni salgo porque nada en lo relativo a esta cuestión depende de mi opinión.&lt;/p&gt;
&lt;p&gt;Sí que me divierte, en cambio, coleccionar casos concretos en el lado incorrecto de las barreras deontológicas que algunos, desde la distancia, proponen.&lt;/p&gt;
&lt;p&gt;Uno es este:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;El 4 de junio de 2026, el medio estadounidense &lt;a href="https://www.semafor.com/article/06/04/2026/a-soccer-team-bet-against-itself-this-is-the-good-future-of-prediction-markets"&gt;Semafor publicó en exclusiva que un equipo de la primera división española había colocado una apuesta multimillonaria contra sí mismo en Kalshi&lt;/a&gt;, una plataforma regulada de mercados de predicción, para cubrirse ante un posible descenso. Semafor no identificó al club, pero la operación se hizo pública con suficiente detalle como para que &lt;a href="https://www.binance.com/en/square/post/332224023515042"&gt;el nombre de Osasuna circulara de inmediato&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.sport.es/es/noticias/osasuna/apuestas-descenso-osasuna-poliza-seguro-131139997"&gt;Osasuna admitió haber contratado una póliza con Howden&lt;/a&gt;, aseguradora especializada en el mundo del deporte, por un importe de 1,2 millones de euros como cobertura ante un posible descenso, pero negó que eso constituyera una &amp;ldquo;apuesta&amp;rdquo;: se trata, según el club, &lt;em&gt;de un seguro cuya función es paliar las pérdidas económicas que habría supuesto perder la plaza en Primera División&lt;/em&gt;.&lt;/li&gt;
&lt;li&gt;El riesgo fue asumido finalmente por &lt;a href="https://sig.com/predictions/"&gt;Susquehanna&lt;/a&gt;, una firma de &lt;em&gt;trading cuantitativo&lt;/em&gt; que, según las fuentes consultadas por Semafor, se llevó más de un millón de dólares.&lt;/li&gt;
&lt;li&gt;No se sabe exactamente qué ruta tomaron estos riesgos, pero se especula que Howden los reaseguró con Game Point Capital, este con Greenlight Commodities y, finalmente, este con Susquehanna usando un contrato OTC a través de Kalshi.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;a href="https://www.gamepointcapital.com/"&gt;Game Point Capital&lt;/a&gt; es una empresa especializada en ayudar a las organizaciones deportivas a gestionar el riesgo financiero asociado tanto al éxito excesivo (p.e., bonus de entrenadores por llegar a &lt;em&gt;playoffs&lt;/em&gt;) como al fracaso (pérdida de ingresos televisivos por descenso). Game Point suele transferir esos riesgos a reaseguradoras como Lloyd&amp;rsquo;s, pero en este caso probó los mercados de predicción, contratando a &lt;a href="https://www.greenlightcommodities.com/"&gt;Greenlight Commodities&lt;/a&gt;, una intermediaria especializada, que ejecutó la operación en Kalshi. Al otro lado de la operación estaba Susquehanna, una firma de trading cuantitativo que, según las fuentes consultadas por Semafor, se llevó más de un millón de dólares. Susquehanna fue en 2023 la primera firma de &lt;em&gt;trading cuantitativo&lt;/em&gt; en crear una mesa dedicada exclusivamente a los mercados de predicción y actualmente opera como «&lt;em&gt;market maker&lt;/em&gt; principal» en Kalshi.&lt;/p&gt;
&lt;p&gt;Un seguro es una apuesta contra uno mismo. Las empresas de seguros tienen que calcular la probabilidad de los eventos que aseguran. Los hay más o menos genéricos (sequías, incendios, etc.). Pero también los hay idiosincráticos (lo que enlaza con la manida discusión acerca del papel de la probabilidad en eventos que solo suceden una vez y que son inasequibles a un tratamiento basado en aproximaciones primitivas basadas en frecuencias). Los mercados de predicciones permiten estimar (y, por lo tanto, valorar) las probabilidades asociadas a ese tipo de eventos.&lt;/p&gt;
&lt;p&gt;Este caso pone en cuestión la tesis de que existen mercados de predicciones &amp;mdash;particularmente, los asociados a eventos deportivos&amp;mdash; que tienen un valor social nulo o, incluso, negativo. O no. Qué sabré yo.&lt;/p&gt;</description></item><item><title>Notas (26): noticias recientes sobre el mundo de los LLMs</title><link>https://datanalytics.com/2026/06/23/cortos-llms/</link><pubDate>Tue, 23 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/23/cortos-llms/</guid><description>&lt;p&gt;Un artículo sobre &lt;a href="https://www.bain.com/insights/synthetic-customers-earn-their-stripes/"&gt;«clientes sintéticos»&lt;/a&gt; para la realización de estudios de mercado (contratar clientes no sintéticos, por si no es evidente, resulta muy caro).&lt;/p&gt;
&lt;p&gt;Otro sobre &lt;a href="https://justinross.substack.com/p/an-ai-interface-for-research-papers"&gt;un posible futuro de los &lt;em&gt;papers&lt;/em&gt;&lt;/a&gt; mediado por el uso masivo de LLMs.&lt;/p&gt;
&lt;p&gt;Mucho se ha escrito sobre el desigual impacto de la IA en las distintas disciplinas y de cómo los sectores más inasequibles a ellas podrían convertirse en cuellos de botella. &lt;a href="https://www.abundanceandgrowth.org/p/ai-science-bottleneck"&gt;Jordan Dworkin traslada ese argumento al mundo de la investigación científica&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;&lt;a href="https://newsletter.semianalysis.com/p/finding-miscompiles-for-fun-not-profit"&gt;Justin Lebar nos cuenta detalladamente su experiencia usando un LLM avanzado para buscar &lt;em&gt;bugs&lt;/em&gt; en compiladores&lt;/a&gt; (y de cómo gastó más de 10.000 dólares en el proceso). Además, la nota del 1 de junio, tras la publicación inicial del artículo, da a entender muy reveladoramente que parte de lo que publicó originalmente ha envejecido rápidamente tras la &lt;a href="https://www.anthropic.com/news/claude-opus-4-8"&gt;publicación de Opus 4.8&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;El FT analiza &lt;a href="https://www.ft.com/content/8e9ae7a4-7209-4e2c-aa36-f3af77d6ce1f"&gt;la productividad aportada por los LLMs&lt;/a&gt; y confirma que muchas empresas están comenzando a sentir el efecto de la C en el ACB (análisis coste-beneficio).&lt;/p&gt;
&lt;p&gt;Sam Harsimony especula con que &lt;a href="https://splittinginfinity.substack.com/p/semiconductors-will-see-an-end-of"&gt;la innovación en semiconductores acabará estabilizándose al cabo de unos treinta años&lt;/a&gt;. Las consecuencias incluyen la caída de precios del &lt;em&gt;hardware&lt;/em&gt; al difundirse la tecnología, la convergencia de la IA hacia un precio uniforme por «unidad de inteligencia» y el fin del sistema cuasimonopolístico que existe hoy en día.&lt;/p&gt;
&lt;p&gt;Simon Willison llama &lt;a href="https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/"&gt;la «tríada letal»&lt;/a&gt; a la combinación de:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;acceso a datos privados,&lt;/li&gt;
&lt;li&gt;exposición a contenido no fiable y&lt;/li&gt;
&lt;li&gt;capacidad de transmitir datos al exterior.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Muerta una cualquiera, se acabó la rabia.&lt;/p&gt;
&lt;p&gt;Finalmente, dos artículos (&lt;a href="https://croissanthology.substack.com/p/llm-cybersecurity-risks-in-the-long"&gt;este&lt;/a&gt; y &lt;a href="https://direct.mit.edu/isec/article/50/3/86/135683/Deception-and-Detection-Why-Artificial"&gt;este&lt;/a&gt;) sobre ciberseguridad que sostienen que, contrariamente a ciertos discursos pesimistas, los LLMs confieren más ventajas a los defensores que a los atacantes.&lt;/p&gt;</description></item><item><title>¿El fin de la teoría [económica]?</title><link>https://datanalytics.com/2026/06/18/fin-teoria-economia/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/18/fin-teoria-economia/</guid><description>&lt;p&gt;En 2008, Chris Anderson publicó en Wired un famoso artículo &amp;mdash;mencionado en más de una ocasión en estas páginas&amp;mdash;, &lt;a href="https://www.wired.com/2008/06/pb-theory/"&gt;&lt;em&gt;The End of Theory: The Data Deluge Makes the Scientific Method Obsolete&lt;/em&gt;&lt;/a&gt;, cuyo argumento no voy a glosar porque es ya cultura general.&lt;/p&gt;
&lt;p&gt;Tyler Cowen ha escrito un pequeño libro, &lt;a href="https://tylercowen.com/marginal-revolution-generative-book/"&gt;&lt;em&gt;The Marginal Revolution&lt;/em&gt;&lt;/a&gt;, con argumentos como:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;El libro de Tyler Cowen examina críticamente la revolución marginalista &amp;mdash;la que estableció los principios teóricos de la economía moderna (¿o clásica ya?)&amp;mdash; y observa el declive de su influencia.&lt;/li&gt;
&lt;li&gt;Según Cowen, el auge de la IA en economía guarda paralelismos con la aparición del marginalismo en la década de 1870: en ambos casos, nuevos métodos demuestran ser superiores a las intuiciones y enfoques previamente dominantes, transformando el panorama intelectual.&lt;/li&gt;
&lt;li&gt;En ámbitos como la economía financiera, el marginalismo está siendo desplazado por métodos cuantitativos y algoritmos capaces de extraer conocimiento de los datos sin apoyarse explícitamente en principios económicos marginalistas. En particular, los modelos de aprendizaje automático están identificando patrones complejos que el razonamiento marginalista no podía detectar, poniendo de manifiesto las limitaciones de las teorías económicas.&lt;/li&gt;
&lt;li&gt;El libro sugiere que muchas de las intuiciones microeconómicas del siglo XX pudieron haber actuado como un sustituto provisional de conocimientos que simplemente no estaban disponibles, y que la IA está revelando la magnitud de aquello que el marginalismo nunca estuvo en condiciones de observar.&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Kepler y Bayes: charla en el PyData de Madrid el día 24 de junio</title><link>https://datanalytics.com/2026/06/16/anuncio-charla-pydata/</link><pubDate>Tue, 16 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/16/anuncio-charla-pydata/</guid><description>&lt;p&gt;El día 24 de junio de 2026 doy una charla en el PyData de Madrid. El anuncio, que me ha llegado &lt;a href="https://guild.host/events/ontologas-anlisis-bayesiano-fg0e21"&gt;vía Guild&lt;/a&gt;, reza:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;PyData Madrid vuelve en junio para hablar de Python, Datos, Visualización, Inteligencia Artificial, ¡Y lo que surja!&lt;/p&gt;
&lt;p&gt;Nuestra última reunión antes del parón veraniego se realizará en las instalaciones de Informática del Ayuntamiento de Madrid (calle Albarracín 33), quienes generosamente nos ceden el espacio.
Tendremos el placer de contar con tres charlas:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;El grupo de Inteligencia Artificial de Informática Ayuntamiento de Madrid (18:45-19:15) hablará sobre LoRO, una ontología desarrollada por el Ayuntamiento de Madrid para la anotación de documentos normativos locales y la construcción de grafos de conocimiento jurídico (en español).&lt;/li&gt;
&lt;li&gt;Carlos Gil Bellosta (19:15-19:45), CEO en Circiter, presentará &amp;ldquo;Kepler y Bayes se encuentran en un bar&amp;rdquo;, sobre el famoso resultado de Kepler sobre las órbitas elípticas y reivindicando métodos bayesianos y análisis de datos pequeños (en español).&lt;/li&gt;
&lt;li&gt;José Manuel Pandelo (19:50-20:00), AI Engineer en Indra, dará una charla rápida sobre los componentes abiertos necesarios para crear arquitecturas de IA soberanas y resilientes (en español).&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;El contenido de mi charla es una versión extendida e interactiva de una entrada de hace un tiempo, &lt;a href="https://datanalytics.com/2026/04/09/kepler-bayes/"&gt;Kepler ∩ Bayes&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Tras la charla, publicaré por aquí las diapositivas.&lt;/p&gt;
&lt;h2 id="coda"&gt;Coda&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="https://datanalytics.com/pdf/2026-charla-pydata-kepler.pdf"&gt;Las diapositivas&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;El &lt;a href="https://www.youtube.com/watch?v=Bh7phaQGSBk"&gt;vídeo&lt;/a&gt; (a partir del 44:00). Desafortunadamente, solo se proyectan las diapositivas y el sonido y la dicción (mea culpa) son muy mejorables.&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>Notas (25): el algoritmo de Feynman para encontrar «el mejor restaurante» y algunos asuntos más</title><link>https://datanalytics.com/2026/06/16/cortos-estadistica/</link><pubDate>Tue, 16 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/16/cortos-estadistica/</guid><description>&lt;p&gt;Matthew Yglesias defiende &lt;a href="https://www.slowboring.com/p/the-neglected-importance-of-boring"&gt;la siempre subestimada importancia de las disputas metodológicas aburridas&lt;/a&gt; en el debate político. Debates aparentemente fácticos en política dependen de &lt;a href="https://datanalytics.com/2026/06/04/jon-gonzalez/"&gt;decisiones metodológicas complejas&lt;/a&gt; sobre las que la gente pasa de puntillas. Por ejemplo, al analizar si los salarios reales en EEUU cayeron entre 1979 y 2014, la conclusión varía drásticamente según los supuestos y deflatores técnicos elegidos.&lt;/p&gt;
&lt;p&gt;En una entrada de 2017 titulada &lt;a href="https://www.lesswrong.com/posts/9Tw5RqnEzqEtaoEkq/if-it-s-worth-doing-it-s-worth-doing-with-made-up-statistics"&gt;&lt;em&gt;If It’s Worth Doing, It’s Worth Doing With Made-Up Statistics&lt;/em&gt;&lt;/a&gt;, Scott Alexander aboga por el uso de estimaciones numéricas aproximadas y «cifras inventadas» en marcos de decisión formales (como el utilitarismo o la inferencia bayesiana). Sostiene que, aunque estas cuantificaciones sean imprecisas, siguen aportando información útil y superan con creces a la intuición humana pura, que, como es bien sabido, suele sufrir sesgos graves.&lt;/p&gt;
&lt;p&gt;Andrew Gelman tiene una extraña entrada en su blog sobre &lt;a href="https://statmodeling.stat.columbia.edu/2026/06/06/what-is-the-relation-between-interactions-in-a-regression-model-and-correlations-among-the-predictors/"&gt;la relación entre las interacciones en un modelo de regresión y las correlaciones entre las variables predictoras&lt;/a&gt;. ¿Qué habrá visto para escribir esto en lugar de abstenerse de ello?&lt;/p&gt;
&lt;p&gt;John D. Cook escribe sobre los &lt;a href="https://www.johndcook.com/blog/2026/05/29/online-one-pass-algorithms/"&gt;algoritmos &lt;em&gt;en línea&lt;/em&gt;&lt;/a&gt; para procesar datos en una sola pasada. Explica además que los algoritmos ingenuos para el cálculo de la media y la varianza son numéricamente inestables y cómo existen procedimientos (como el algoritmo de Welford de 1962) para evitar esos problemas.&lt;/p&gt;
&lt;p&gt;Se ve que &lt;a href="https://www.theguardian.com/science/2026/jun/01/scientists-uncover-feynmans-formula-for-finding-best-holiday-restaurant"&gt;Feynman propuso un algoritmo para determinar el mejor restaurante&lt;/a&gt; (en un contexto similar al del &lt;a href="https://en.wikipedia.org/wiki/Secretary_problem"&gt;problema de la secretaria&lt;/a&gt;). Muy resumidamente, consiste en probar un restaurante nuevo cada día &amp;mdash;exploración&amp;mdash; hasta que se alcanza un umbral de calidad &amp;mdash;explotación&amp;mdash;, que decrece a medida que se acaban las vacaciones.&lt;/p&gt;</description></item><item><title>Sobre el «affaire» Jon González</title><link>https://datanalytics.com/2026/06/11/jon-gonzalez/</link><pubDate>Thu, 11 Jun 2026 00:00:00 +0000</pubDate><guid>https://datanalytics.com/2026/06/11/jon-gonzalez/</guid><description>&lt;p&gt;Jon González tenía una cuenta popular en Twitter. Unos tipos a los que no les gustaba lo que contaba urdieron una estrategia, eventualmente exitosa, para taparle la boca. Eso está contado en muchas partes, como por ejemplo, &lt;a href="https://www.elmundo.es/economia/empresas/2026/05/11/6a01f586e9cf4a85728b456e.html"&gt;esta&lt;/a&gt;.&lt;/p&gt;
&lt;p&gt;Jon González era conocido por sus gráficos, que acompañaban a sus análisis y opiniones sobre diversos aspectos de la economía española. Se trata de un asunto que no me interesa demasiado porque aunque me afecta, carezco de instrumentos para actuar sobre él de forma efectiva. Es un poco como el tiempo: no soy yo el que hace llover; de igual manera, yo no subo los tipos de interés ni redacto la legislación laboral, así que invierto mi tiempo en otra cosa.&lt;/p&gt;
&lt;p&gt;Cuando surgió el revuelo me interesé no obstante en el personaje y tomé uno de sus gráficos,&lt;/p&gt;
&lt;p&gt;&lt;img alt="Jon González" loading="lazy" src="https://datanalytics.com/img/2026/jon-gonzalez-orig.png#center"&gt;&lt;/p&gt;
&lt;p&gt;que había dado pie a una discusión que no viene al caso sobre la menguante línea roja.&lt;/p&gt;
&lt;p&gt;Por entretenerme, le pedí a un LLM que replicase el gráfico. Hubo problemas porque las fuentes de datos que usaba González no eran públicas, así que el LLM tomó las de Eurostat. Luego, estas no tenían la misma profundidad histórica (1995 para González, 2000 para Eurostat). Luego, los conceptos están abiertos a interpretación: ¿Divides por población global? ¿O por trabajador? ¿O por hogar? Como esas cuestiones nunca están claras, opté por usar el denominador más propicio para las tesis de González, la población total.&lt;/p&gt;
&lt;p&gt;Y obtuve este resultado:&lt;/p&gt;
&lt;p&gt;&lt;img alt="Jon González" loading="lazy" src="https://datanalytics.com/img/2026/jon-gonzalez-replicated.png#center"&gt;&lt;/p&gt;
&lt;p&gt;En él, la línea roja tiene una trayectoria igualmente mediocre, pero de una manera bastante menos dramática que en el original.&lt;/p&gt;
&lt;p&gt;¿Por qué me entretengo en esto? Hay un motivo que trasciende la anécdota de lo tristemente ocurrido con González. Digamos que alguien tiene una tesis y como argumento de persuasión construye un gráfico. Un gráfico no es la realidad sino una representación de ella medida por un sinfín de decisiones. Si estas se hubiesen resuelto de otra manera, el gráfico podría haber sido no solo diferente, sino incluso «opuesto» (en el sentido de que podría utilizarse para rebatir la tesis original).&lt;/p&gt;
&lt;p&gt;Además, ocurre muy frecuentemente que quien plantea una tesis no lo haga con una voluntad puramente descriptiva sino en la medida en que es coherente con una agenda subrepticia. Es decir, que tiene interés en que sus números y sus gráficos adquieran una determinada forma. Si para construir un gráfico hay que tomar, por simplificar, diez decisiones binarias, es posible construir $2^{10}$ gráficos diferentes, todos ellos &lt;em&gt;correctos&lt;/em&gt;. Si eliges entre las distintas opciones de manera que siempre lo sesguen en una dirección, obtendrás una muestra en la cola de la distribución de los 1024 gráficos posibles y casi cualquier reconstrucción del mismo parecerá refutarlo.&lt;/p&gt;
&lt;p&gt;Pero qué sabré yo y por qué escribiré sobre esto.&lt;/p&gt;
&lt;p&gt;(El código usado en la replicación puede consultarse &lt;a href="https://github.com/cjgb/datanalytics_code/tree/main/2026-jon-gonzalez-replication"&gt;aquí&lt;/a&gt;.)&lt;/p&gt;</description></item></channel></rss>